新模型发布
大语言模型 LLM / 多模态模型 VLM
第一步:官方规格摸底
硬参数 / License / API 定价 / 白皮书质量
第二至四步:真人盲测与独立基准
第三方复测是否与官方口径一致,是整条链路的关键对账点
LMArena 分榜
LiveBench
Artificial Analysis
OpenCompass
存在严重落差
高度警惕:疑似评测集污染或榜单过拟合
核心基本一致
可进入候选池:继续核对工程指标与成本
第五步:生态真实热度与工程适配
开发者是否真金白银地在用、推理框架是否快速适配、社区有没有翻车记录
OpenRouter 用量
推理框架 PR
社区翻车记录
最终决策
输出模型调研速查卡并定性:降本平替 / 能力突破 / 营销刷榜
独立客观评测LiveBench · AA
真人盲测偏好LMArena
市场 / 生态信号OpenRouter · GitHub
第二部分核心信息源与评测维度全景
榜单很多,可信度和「能说明什么」差别很大。用之前先分清每个来源测的是什么、有多容易被厂商影响。
| 信息源 | 测的是什么 | 污染风险 | 该看什么 |
|---|---|---|---|
| 厂商技术报告 / 模型卡官方口径 | 自报成绩、参数、License、定价 | 低 | 硬参数、消融实验是否详实、有没有第三方可复现的细节。数据集与提示词都能定制,只作第一层初筛 |
| LMArenaarena.ai | 真人两两盲测投票得出的 Elo 偏好分 | 中高 | 分榜(Hard Prompts / Coding / 中文)、置信区间与投票量。众包匿名对战不易被定向优化,但回答更长、风格讨喜也会加分 |
| Artificial Analysisartificialanalysis.ai | 统一环境下复测的智能指数、速度、延迟与真实成本 | 高 | Intelligence Index 版本、Cost per Task、TTFT、输出速度。第三方独立复测,口径统一、可追溯 |
| LiveBenchlivebench.ai | 每月更换题目的客观题基准 | 高 | Reasoning、Data Analysis 分项。题目持续更新,是当前防污染做得较好的基准之一 |
| OpenCompass 司南rank.opencompass.org.cn | 中文与多模态能力的综合客观评测 | 中高 | 中文榜、多模态榜、能力雷达图的短板项。国内较权威,但部分子集长期固定,存在被针对性优化的空间 |
| OpenRouter 用量榜openrouter.ai/rankings | 开发者真金白银消耗掉的 token 量 | 高 | New & Trending、周榜的持续走势(而非单日冲高)。花的是自己的钱,难以刷 |
| GitHub / HF / 魔搭开源生态 | 开源生态的适配进度与下载趋势 | 中 | 主流推理框架的合并 PR、第三方量化是否跟进。下载量可被镜像和批量脚本注水 |
| Reddit / X 一手反馈r/LocalLLaMA 等 | 真实提示词下的翻车案例 | 中 | 是否有多位独立用户复现同类失败。样本零散、带情绪,但常能最早暴露系统性问题 |
「客观题高分」和「实际好用」是两件事。客观基准看能力上限和稳定性,盲测看手感与表达,市场用量看真实场景能否跑通;三者不能互相替代,任何单一来源都不足以支撑结论。
第三部分30 分钟快速初筛标准作业程序
新模型发布后,不必等评测机构出长文,按下面五步走,30 分钟左右能拿到一轮带风险标注的初筛结论。
顺序说明:五步按「去哪儿找信息」组织,与第一部分的层级链路并不完全对应。比如工程指标要等 Artificial Analysis 收录后才有,通常晚于社区热度,不必纠结先后。
官方规格摸底
官方博客huggingface 模型卡modelscope 模型卡
- 打开官方博客或 huggingface / modelscope 模型卡,下载技术白皮书存好。Step 4 要拿它的数字和 LiveBench 对照。
- 确认模型类型:Base(基座)/ Instruct(指令对齐)/ Reasoning(推理)。类型不同,能直接对比的榜单也不一样;拿 Instruct 的总分去比推理模型的总分,结论会偏。
- 记录硬规格:上下文窗口上限、API 每百万 Token 输入 / 输出单价、License 是否允许商用。许可证不允许商用,或上下文撑不住你的输入长度,后面几步就不用看了。
看真人盲测与中文表现
arena.ai
- 打开 arena.ai,查看新模型的 Elo 排名。
- 别只看总榜:用 Filters 与同档位竞品横向对比,重点看 Hard Prompts(复杂指令与逻辑上限)、Coding、Chinese 三个分榜。
- 总榜排名要连置信区间一起读:区间过宽(通常刚发布、投票量不够)时,结论里注明「样本量不足,排名暂不稳定」,别把它当成确定的名次。
算工程性价比
artificialanalysis.ai
- 打开 artificialanalysis.ai,搜索该模型。
- 在 Intelligence vs Cost 散点图上确认位置:是否落在 Pareto Frontier(同等智能里价格最低,或同等价位里智能最高)。同时看 Cost per Task:推理型模型输出更长,实际每次任务的支出常高于用单价直接乘出来的估算,这个指标比 token 单价更接近真实账单。
- 检查工程性能指标:TTFT(首字延迟)与输出速度 Output Tokens/s 是否满足线上业务的延迟要求。
用独立基准交叉验证
livebench.airank.opencompass.org.cn
- 打开 livebench.ai,看最新一期题目里的成绩,重点看 Reasoning 与 Data Analysis。这个榜每月换题,相对不容易靠刷旧题拿高分。
- 拿 LiveBench 的分数跟 Step 1 里官方报告的数字对一遍:官方成绩亮眼、LiveBench 却明显落后,就在报告里标记「疑似评测集污染,高分低能」。这是整个 SOP 里最关键的一次交叉验证。
- 需要评估中文本土化或多模态落地时,再打开 rank.opencompass.org.cn,看司南榜单的能力雷达图,重点找短板项而不是看总分。
看生态热度与真实翻车记录
openrouter.ai/rankingsGitHubr/LocalLLaMA · X
- 打开 openrouter.ai/rankings,看 New & Trending 里的位置:有没有独立开发者在用自己的钱调用它。
- 开源模型去 GitHub 搜模型名,看 vLLM、SGLang、Ollama 等仓库的 Pull Requests:主流推理框架有没有很快合入架构适配。只有权重、没有推理框架支持,落地成本会明显上升。
- 到 Reddit r/LocalLLaMA 或 X 搜「模型名 + fail / hallucination / bug」,找真实提示词下的失败案例。注意区分两类反馈:多人独立复现的同一类失败是系统性问题,单条吐槽可能只是提示词没写好。
这 30 分钟得到的是初筛,不是终审。它足以排除明显注水或明显不匹配的候选,但最终选型还要补上真人盲测和自己业务提示词的私有评测。
第四部分带模板的提示词(复制即用)
下面这段提示词可直接粘给任意大模型,让它按同一套口径帮你补全调研卡片。提示词里已内嵌卡片模板,模型会按模板逐项回填,不用你自己拼。
research-card · AI MODEL RESEARCH CARD PROMPT
你是一名 AI 模型选型分析师。请对模型【模型名称/版本】做一次公开信息交叉验证,并严格按下面给出的卡片模板输出一份 AI MODEL RESEARCH CARD;模板中的每一项都要填上,不要增删字段顺序。 核对来源(只使用可公开查证的信息): 1. LMArena(arena.ai):总分榜与 Coding / Hard Prompts / 中文分榜排名、票数、置信区间。 2. Artificial Analysis:智能指数(写明版本)、Cost per Task、Output Tokens/s、TTFT。 3. LiveBench:Reasoning 与 Data Analysis 分项得分。 4. OpenCompass 司南:中文榜与多模态榜排名。 5. OpenRouter 用量榜:Today / Week / Trending 位置与走势。 6. 需要时补充 Arena-Hard v2 得分,以及开源模型的 HF / 魔搭下载趋势、第三方量化与推理框架适配情况。 填写要求: 1. 每个数字后面标注来源平台和查询日期;查不到的项写「未查到」,不要推测,也不要留空。 2. 官方自报成绩与第三方复测结果存在明显落差的指标,单独列出来并说明落差在哪里。 3. 第 5 项判定只能从「降本平替型 / 能力突破型 / 营销刷榜型」中选择,可以都不选,但必须说明理由。 4. 卡片之后,另附三到五条这份结论中最不确定的地方,供人工复核。 输出模板: ───────────────────────────────────────────── AI MODEL RESEARCH CARD ───────────────────────────────────────────── 【1. 基础规格、合规与技术背景】 模型名称/版本: 发布组织: 开源协议 (License): 总参数 / 激活参数 (MoE): 上下文窗口 (Context): 原生能力: [ ]Thinking [ ]Tool-Calling [ ]多模态 技术白皮书质量: [ ]优秀(消融实验详实) [ ]一般(无技术细节,仅营销稿) API 每百万 Token 价格: 输入 $______ / 输出 $______ 【2. 能力与手感验证】 LMArena 排名 / Elo: 核心分榜 (Coding / Hard Prompt / 中文): LiveBench 推理 / 数据分析得分: Arena-Hard v2 得分: OpenCompass 综合 / 中文排名: 防污染结论: [ ]一致 [ ]疑似刷榜/过拟合 【3. 工程落地与用量】 Artificial Analysis 智能指数(版本): 输出速度 (Tokens/s) / 首字延迟 (TTFT): Cost per Task: 是否落在 Pareto Frontier: OpenRouter 消耗量排名 (Today / Week / Trending): 【4. 生态集成度(仅开源权重模型)】 HF / 魔搭 近期下载趋势: 第三方量化 (GGUF/AWQ) 丰富度: 工程后端适配: [ ]vLLM [ ]SGLang [ ]Ollama [ ]llama.cpp 【5. 综合判定(可多选)】 - [ ] 降本平替型:能力没有突破,但靠极低单价或极高速度,在性价比前沿线上胜出。 - [ ] 能力突破型:刷新了 Hard Prompts、LiveBench 等榜单的上限,有可验证的推理或 Agent 长板。 - [ ] 营销刷榜型:官方数据亮眼,LiveBench 上掉队,OpenRouter 用量一周后高开低走。 填卡备注: - 白皮书只有营销稿、没有技术细节时,第 5 项结论必须加重「待人工验证」的标注。 - 本卡片是公开信息交叉验证的初筛结论,不能替代自己业务提示词上的私有评测。 ─────────────────────────────────────────────