指标与排序说明
这里解释一览表上每个分数的含义、排序方式的区别、两套榜单口径的对照,以及数据来源。分数均为 0–100 的锚定分(相对固定锚点,而非当日池内排名),不是绝对能力值。
一、分数是什么意思
- 综合分:总体印象分,适合先看个大概。
- 共识分:把 5 家权威榜单(综合能力、竞技场对战、编程、Agent、推理)按权重合成一个分,适合通用选型;括号里的 n/5 表示有几家榜单覆盖了该模型。每族先换算成固定锚定分(0–100)再加权:新模型加入不再拉动老模型的分数,榜首加权约 90 分而非 100(锚点处各族约:AA 92、Arena 84、编程 92、Agent 93、推理 90)。
- 编码分 / Agent 指数 / 推理分:单项能力分。写代码看编码分,做自动化工作流看 Agent 指数,做数学和深度推理看推理分。
- 性价比:便宜 + 长上下文 + 够聪明三者兼顾,预算有限时看它。
- 权威单项:榜单成绩原始数据,想看某一项的硬成绩直接看这里:
- SWE-bench Verified / Pro:修真实 GitHub Bug 的能力,编程硬指标。
- Terminal-Bench:在终端环境里执行任务的能力。
- GPQA / HLE:研究生级理科问答与高难度综合考试,考知识与推理。
- Arena ELO:人类投票对战排名(文本 / 视觉 / 网页开发),看综合口碑。
- OSWorld / BrowseComp:操作系统操作与联网调研的 Agent 能力。
- 速度:每秒输出 token 数,实时交互场景关注它。
模型详情里每个分数后的 (名次/总数),表示该分数在全池同维度下的排名,比如 (5/1046) 即该项第 5 名。
二、排序怎么选
- 主排序(综合 / 共识 / 编码 / Agent / 推理 / 性价比):六选一,按你的用途挑一个即可。
- 权威榜单 / 性能与能力:想看某一原始榜单的成绩时用,同样一次只按一种排。
- 筛选(厂商 / 开源 / 价格 / 能力):可以和任何排序叠加,只过滤行、不改变排序。能力即排序 tab 的同名维度是否有成绩:多模态、Agent(有成绩)、编码(有成绩);全池仅 16–21% 模型有 Agent/编码成绩,缺成绩≠差。
缺数据的模型排在后面,显示为 —,不代表它差,只代表暂无该项成绩。
三、榜单口径:本站计算 vs 权威榜单引用
本站同时提供两套口径,二者物理隔离、互不混排:
- 本站计算(归属一览表排序):共识分(AA 30% + Arena 20% + 编程 20% + Agent 15% + 推理 15%,每族锚定分加权,≥2 证据才入榜,缺失权重再归一)与 4 个单维专项:编码 / Agent / 推理 / 性价比(性价比 = 价格低 + 上下文大 + 智能分的锚定 Pareto 权衡)。均为派生计算,非引用。
- 权威榜单引用(归属专项榜 /rankings/):周调用榜(OpenRouter 周 token 调用量 Top10,流行度非能力)与 OpenRouter 定义的专项榜:最强开源 / 最具性价比 / 最快 / 最强编码。名次即 OpenRouter 页顺序,不做二次加权;榜单标题统一前缀 OpenRouter · ,每块提供“查看原榜 →”溯源外链。
防撞说明:OpenRouter · 最具性价比 ≠ 本站性价比(前者是 OpenRouter 榜名次,后者是本站 Pareto 计算);OpenRouter · 最快 ≠ 本站速度(前者榜单名次,后者实测 tok/s);OpenRouter · 最强编码 ≠ 本站编码分(前者原榜,后者 coding_index + SWE-bench 归一)。标题前缀 OpenRouter · 用于区分。
本站编码 / 推理 Top10 已同步展示在专项榜页顶部(与一览表同源的本站计算,组内取该项最高分,标题前缀“本站 · ”),与 AA · / OpenRouter · 引用榜并存时以前缀区分:本站榜是派生计算,引用榜是原榜名次原样呈现。
当前收录榜单以页面实际展示为准,缺榜自动隐藏(单榜数据缺失不影响其他榜单)。周调用榜亦在此口径区,不在一览表内重复展示。
四、数据哪里来
- Artificial Analysis:智能 / 编程 / Agent 指数。
- LM Arena:人类投票对战 ELO(文本 / 视觉 / 网页开发)。
- BenchLM:SWE-bench、GPQA、HLE 等专项基准成绩。
- OpenRouter:价格、上下文窗口、周调用量及 OpenRouter 榜单原数据。
- Hugging Face:开源权重信息。
- 各厂商官方发布页与官方博客。
分数栏不再逐行标注来源,所有口径统一在这里说明。
价格说明:优先采用官方价格;官方未公布时采用其他可靠途径(如聚合商报价),并在行内 hover 显示来源;估算值标 ≈。不同服务商的同模型报价可能有差别,请以官方价格为准。
数据每日更新。当前口径 Index v2。共识 / 综合 / 编码 / Agent / 推理 / 性价比六个分数为锚定分(绝对口径,可跨天对比);条形宽度一般为相对百分位(池内位置),综合分条形除外、宽度即其绝对分。
五、想看更多榜单?
当前提供引用榜(OpenRouter / AA)与本站计算榜(编码 / 推理 Top10),如果希望增加其他类型榜单,欢迎反馈建议。