光看榜单感觉也不是很靠谱。
1
alanying OP 其实是 Qwen3.8 > GLM5.2 > K3 > DPSKv4 Pro 的但是标题写 Qwen3.8 怕被喷
|
2
shintendo 8h 8m ago
GLM5.2 > K3 是认真的吗
|
3
foryou2023 8h 3m ago
估计得重新测试了,官网刚刚才更新了更新日志,就是官方的 harness 还不发布,不知道啥时候发布。
|
4
shintendo 8h 0m ago
@foryou2023 说是明天
|
5
Miaoz 7h 9m ago GLM5.2 > K3 认真的吗 +1
|
6
jackerbauer 6h 21m ago
主观太强
|
7
jackerbauer 6h 20m ago
不过 GLM5.2 > K3 ,确实离谱
|
8
cue 6h 17m ago via iPhone
你们部门……是千问团队吗……
|
9
Qmanman 6h 16m ago via Android
glm5.2 不太行
|
10
isbase PRO 据说模型上错了 再用目前的版本试试
|
11
alanying OP |
13
bowen628 4h 26m ago
官方 harness 已经发了,包名 @deepseek-ai/dsh ,这轮盲测可以顺手重跑一次。模型横评不固定壳,工具 schema 、prompt 拼法、上下文回放全会混进分数,最后测的其实是 model+harness 。利益相关:我参与 BitFun ,我们这边一直把 prompt 做成字节级稳定,SWE-Bench-Pro 那轮 KV cache 平均命中 98.67%;拿同一仓库在 DSH / BitFun 交叉跑,应该比只看榜单有意思。
|
14
Tink 4h 25m ago
测试方法是啥啊?
|
15
exhades 4h 20m ago
GLM5.2 是什么路边,我这边都是 K3 > qwen3.8max > dsv4Pro > GLM5.2
|
16
cowcomic 4h 10m ago
据说已经下架了
|
19
renzhe8102 2h 32m ago via Android
@exhades k3 路边
|
20
FantaMole 1h 51m ago
之前在梁子的那个内部会议的纪要出来的时候,我就在论坛里的一个帖子提过 DeepSeek 一直是个小而美的公司,梁子本人是很有理想,但是其他人是要吃饭的,这个扁平化的理想主义管理架构在拉进来一堆人之后可能很难管。就 13 号这个混乱百出的样子,感觉可以一窥内部的失控样子
DeepSeek Pro GA 没有让我感到有惊艳的地方,由于公司项目我搭了一套 AI Coding Framework ,所以只要模型不是太差,能够有 GLM5.2 级别的能力,大部分工作不会有太多体感差距。不过今天处理的一个复杂问题,处理结果不及预期,最后是用 opus5 处理掉的 DeepSeek Harness ,刚刚才有空探索了一下项目,准备明天尝试一下。不过看知乎上的评价,感觉一堆人说了半天没有重点不知道说了什么东西,全在聊拓展性 |