• 请不要在回答技术问题时复制粘贴 AI 生成的内容
fankcoder
V2EX  ›  程序员

大模型排行榜到底哪个权威?

  •  
  •   fankcoder ·
    fankcoder · 15h 27m ago · 5518 views

    Qwen3.8-max 出了,今天看排行榜 3 个榜 3 个名次,该信哪个呢?

    1. 排行第 4 https://arena.ai/leaderboard/code/webdev
    2. 排行第 7 https://llm-stats.com/
    3. 第十名之后去了 https://artificialanalysis.ai/leaderboards/models
    41 replies    2026-08-04 22:06:39 +08:00
    vzextreme
        1
    vzextreme  
       15h 22m ago
    看厂商对哪家测评机构特调🐶
    cowcomic
        3
    cowcomic  
       15h 14m ago
    arena 是匿名对比得分,这类稍微更偏向普通人的感官,我个人比较倾向这种竞技场排行的
    其他数据集评测的主要还是看测试数据分布和泄露情况了

    中文也有榜单
    https://www.superclueai.com/homepage
    tcper
        4
    tcper  
       15h 13m ago   ❤️ 5
    看评分标准,
    arena 就是通过匿名选择喜好,体现用户体验
    llm-stats 是多个评分集的聚合
    AA 自建评测集,这些集体现大模型对未知问题的推理能力

    不过客观来说,llm-stats 的聚合更能体现全面成绩,因为就算刷烂的题目成绩很好也不错了,起码能覆盖日常遇到的问题,并不是大模型都要去解决未知问题。
    lel020
        5
    lel020  
       15h 12m ago
    牛马 agent 使用还是得看社区评价,什么跑分都靠不住,
    Bootis
        6
    Bootis  
       14h 58m ago
    arena 都是 one shot 提示词任务,大型工程的复杂任务能力看这个榜单参考价值不大
    fankcoder
        7
    fankcoder  
    OP
       14h 57m ago
    @tcper 感谢
    opeth
        8
    opeth  
       14h 56m ago
    我基本上就看 artificial analysis 和最强野榜 https://llm2014.github.io/llm_benchmark
    wang93wei
        9
    wang93wei  
       14h 54m ago
    我个人觉得 DeepSWE 这个更权威一些。https://deepswe.datacurve.ai/
    klion
        10
    klion  
       14h 51m ago   ❤️ 1
    https://artificialanalysis.ai/leaderboards/models 里面重点关注这几个指标就知道,这些才是真正的模型智能

    Terminal-Bench Hard

    AA-Omniscience Accuracy

    Humanity’s Last Exam

    GPQA Diamond
    xiaoxixi
        11
    xiaoxixi  
       14h 32m ago
    好多排行站,之前都没关注过
    soulflysimple123
        12
    soulflysimple123  
       14h 14m ago
    https://artificialanalysis.ai/
    我看 Qwen3.8-max 里面还没有
    sillydaddy
        13
    sillydaddy  
       13h 53m ago
    我目前只看 arena ,它是基于两两比赛得到的,裁判是广大用户。
    rich1e
        14
    rich1e  
       13h 4m ago
    排行榜上的权威与真实体验,一些情况下并不相符合

    就像,在国产模型上使用 CC ,编程体验也还不错,但是遇到一些特定场景(视频分析 / 复杂逻辑推理),可能就不能工作

    - 视频分析时,可能会用到 claude vision
    - 复杂逻辑推理,会触发多个模型之间并行工作( Opus / Haiku / Sonnet )

    以上这些,如果模型没有适配,CC 就无法工作

    所以,大模型排行榜看看就好,权威也改变不了真实体验

    推荐这个,https://x.com/karpathy/status/2083749667410727319
    nakun233
        15
    nakun233  
       12h 56m ago
    当然是 DeepSWE 1.1
    kuhung
        16
    kuhung  
       12h 37m ago
    我个人还关心价格,即性价比。到了当前阶段,模型提升带来的体验上升已经很难如年初 opus4.6 那样了。我自己写了一个 https://www.traktoken.com/ 用来比价。此外,开发过程中还发现国外金融机构在观测 token 支出指数,用来指导投资,所以复现了一个 https://www.traktoken.com/spend-index 。从落地页来看,后者目前占一半的流量。
    sxbaixing
        17
    sxbaixing  
       12h 31m ago
    千问向来是跑分高,体验差
    mmdsun
        18
    mmdsun  
       12h 24m ago via iPhone
    论知名度还是 arena 靠谱
    OumaeKumiko
        19
    OumaeKumiko  
       12h 18m ago
    竟然还没有人发东山奈央的😂 俺也不知道是否权威
    [toyama nao - 知乎]( https://www.zhihu.com/people/toyama)
    uncleroot
        20
    uncleroot  
       12h 14m ago
    不知道有没有各种语言的“人味”排行。机器味太重了
    wakarimasen
        21
    wakarimasen  
       12h 9m ago via Android
    权威这两个字令人困惑。

    如果你要权威数据应该看厂商发布的第一方数据
    Wcowin
        22
    Wcowin  
       12h 6m ago
    具体场景具体分析吧,适合自己就是最强的。
    jonsmith
        23
    jonsmith  
       10h 45m ago
    编程方面不看好 Qwen ,跟 Gemini 一样,跑分高、编程能力不行。
    cabudad
        24
    cabudad  
       10h 30m ago
    什么排行榜都没有自己亲身使用权威,好不好用了才知道
    SeleiXi
        25
    SeleiXi  
       10h 26m ago
    让 gpt 找一些比较新+作者比较权威的 benchmark 调研一下,一般比较老或者比较有影响力的早就过拟合过了
    ybybwdwd
        26
    ybybwdwd  
       9h 4m ago
    @cowcomic arena 是可以刷的,可以用提示词试出是哪个模型
    levn
        27
    levn  
       8h 53m ago
    普通人类评价早就已经没用了在大多数时候
    jark006
        28
    jark006  
       8h 50m ago
    我比较信 DeepSWE
    Bootis
        29
    Bootis  
       8h 46m ago
    escapefear
        30
    escapefear  
       7h 43m ago
    我奉行对标谁就用谁的原则
    LK996
        31
    LK996  
       7h 37m ago
    和手机评测一样,都是给够前就上的婊子,没有干净的
    Znemo
        32
    Znemo  
       7h 24m ago
    哪个 Gemini 排名最低相信哪个。
    William337
        33
    William337  
       7h 24m ago
    没有,需要自行判断,仅供参考
    Haku
        34
    Haku  
       7h 19m ago via Android
    arean 是竞技场天梯,分数有保障,但是仅限前端(编程是只有前端)
    aes114514gcm
        35
    aes114514gcm  
       6h 31m ago
    @OumaeKumiko 8 楼的 https://llm2014.github.io/llm_benchmark 就是 toyama nao 的网站。个人感觉比较准确。
    JerryZhi
        36
    JerryZhi  
       6h 18m ago
    目前普遍思路是采集十几个排行榜求平均(或者加权)
    cellsyx
        37
    cellsyx  
       6h 1m ago
    比较符合个人体验的是 DeepSWE (不包括前端设计能力)
    FlashEcho
        38
    FlashEcho  
       5h 36m ago
    根据使用场景来的,如果你的需求只是和模型聊聊天,当成高级版豆包,那 Arena AI 其实最准
    Glauben
        39
    Glauben  
       4h 51m ago
    我有一个疑问,5.6SOL codex 明明是 258K272K ,为什么这些排行榜上都是 1.1M
    Mandelo
        40
    Mandelo  
       4h 8m ago
    没一个权威的,或者说测试的东西和你工作用用到的完全不是一个东西。
    mingtdlb
        41
    mingtdlb  
       2h 49m ago
    arena 的 side-by-side 不是一样可以选哪个更好,但这个结果是否参与排名不懂得,如果参与,那就可以刷了。。。

    我认为实际还是要自己测试,给一个任务,看哪个模型做的最合你意。排行榜随便看一个就行,一般都相差不会太多,比如 ds 在排行榜 1 是第十,在排行榜 2 就不会跑到第 30 去
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1364 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 111ms · UTC 16:56 · PVG 00:56 · LAX 09:56 · JFK 12:56
    ♥ Do have faith in what you're doing.