sentinelK's recent timeline updates
@kop1989 @kop1989smurf
三转
May 31, 2023
我本将心向明月,奈何明月照沟渠。
May 30, 2023
sentinelK

sentinelK

V2EX member #631792, joined on 2023-05-30 20:41:02 +08:00
Today's activity rank 8311
kop1989的三转小号
deepseek-flash 的第三方跑分趣闻
DeepSeek  •  sentinelK  •  Sep 11  •  Lastly replied by sentinelK
3
sentinelK's recent replies
经此配置后,strata + qwen3.8-flash-next IQ3 这套组合,在驱动 harness 这个领域,除了并发效率以外,已经完美吊打 sglang+qwen3.8-27B-nvfp4 这套传统的全量显存组合。

首先,strata 因为基于 llama.cpp ,所以不存在 memba 层和 kvcache 层的抉择问题。
其次,IQ3_XXS 的 qwen3.8-flash-next ,模型能力本身超过 qwen3.8-27B-nvfp4 。
最后,无论是 prefill 的稳定度还是 decode 速度,strata 这套混合架构+MOE 模型,均超越了 27B 稠密模型的性能表现。
是的。
但是商业社会从来不是用产品的“技术含量”、“革新程度”来定价的。

微信和米聊相比,有什么创新吗?甚至主色调都一致,但这不妨碍微信干死米聊。
@nightwitch 合作是有的,在 ds 涨价成峰谷之前,opencode go 就是 100%的官方中转。

涨成峰谷之后,opencode 就有自部署的尝试了。之前还是灰度的。
这次是完全自部署。
opencode 也是,名义上 60$永久,但本质上从官方中转换成了自部署。

tg 只有不到 100t/s ,缓存命中率 95%。更恶心的是上了一些莫名其妙的限制。比如同 session 只能最大 30 张图片。
Sep 24
Replied to a topic by ghmum › OpenAI › 想用 ds4.1,应该用哪个 harness?
1 、deepseek 的 API 天然支持 responses (三种 API 格式都支持),所以接入 codex 不需要中转。中转会出现莫名停止的问题。

2 、claude code 这种闭源的最好别用,总是更一些 API 的 feature ,导致缓存命中概率降低。

3 、从情理上讲,人们总是认为自家模型适配自家 harness 工具应该是最好的,但实际未必。
以后很有可能文学 LLM 和业务 LLM 会彻底分家,比如更多类似 https://huggingface.co/Altworld/Hemmingway-1 会冒出来。
@viskem 是的,我理解就是人话里面有太多“模糊”和“婉转”了。现实任务其实是定量的,或者说人类的活动为了精准故意设定成了定量为主。所以“讲人话”对于 LLM 的 Agent 场景来讲,其实是一种噪声信息,反而降低了统计学最优解的信噪比。
跟后训练对齐的方式有关。“人话”从目前的跑分(强化学习目标)的角度来讲,是一种很低效的指标。

换句话说,人话在 Agent 、Coding 这种场景是非常反效率的。
看楼上的回复,感觉好多人对于跨平台有很大误解。认为跨平台和原生的代码量是 1:2 ,我个人理解,无论是什么跨平台生态,和原生的代码量基本是 1:1.5 ,甚至是 1:1.3 。
自动停止是 cc-switch 代理转换的问题。

在目前,你可以理解为 codex 只能跑支持 responses API 的模型 provider
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   908 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 20ms · UTC 20:24 · PVG 04:24 · LAX 13:24 · JFK 16:24
♥ Do have faith in what you're doing.