模型选型方法论 · 供技术团队与独立开发者

新一代大模型调研指南
交叉验证 SOP

不追求绝对精确地「测出智商」,而是用几个互相独立的信息源交叉验证,把新发布的模型(LLM / VLM)的实际能力、使用手感、工程落地性价比判断到够用的程度。

4 层验证链路 3 类独立证据 5 步 · 30 分钟初筛 8 个核心信息源
少信官方口径,多看第三方实测和市场真实用量。

新模型发布越来越密,厂商挑几套学术数据集做定向微调、把榜单分数刷上去(Data Contamination,数据污染),已经是常规操作。所以每轮调研至少凑齐三类互相独立的证据,三者互不冲突,结论才立得住。

第一部分大模型水准调研核心流程

四层验证链路自上而下走一遍:先摸清官方口径,再用第三方盲测与独立基准对账,落差处就是风险所在,最后用生态用量完成终审。

新模型发布

大语言模型 LLM / 多模态模型 VLM

第一步:官方规格摸底

硬参数 / License / API 定价 / 白皮书质量

第二至四步:真人盲测与独立基准

第三方复测是否与官方口径一致,是整条链路的关键对账点

LMArena 分榜 LiveBench Artificial Analysis OpenCompass

存在严重落差

高度警惕:疑似评测集污染或榜单过拟合

核心基本一致

可进入候选池:继续核对工程指标与成本

第五步:生态真实热度与工程适配

开发者是否真金白银地在用、推理框架是否快速适配、社区有没有翻车记录

OpenRouter 用量 推理框架 PR 社区翻车记录

最终决策

输出模型调研速查卡并定性:降本平替 / 能力突破 / 营销刷榜

独立客观评测LiveBench · AA
真人盲测偏好LMArena
市场 / 生态信号OpenRouter · GitHub

第二部分核心信息源与评测维度全景

榜单很多,可信度和「能说明什么」差别很大。用之前先分清每个来源测的是什么、有多容易被厂商影响。

信息源 测的是什么 污染风险 该看什么
厂商技术报告 / 模型卡官方口径 自报成绩、参数、License、定价 低 硬参数、消融实验是否详实、有没有第三方可复现的细节。数据集与提示词都能定制,只作第一层初筛
LMArenaarena.ai 真人两两盲测投票得出的 Elo 偏好分 中高 分榜(Hard Prompts / Coding / 中文)、置信区间与投票量。众包匿名对战不易被定向优化,但回答更长、风格讨喜也会加分
Artificial Analysisartificialanalysis.ai 统一环境下复测的智能指数、速度、延迟与真实成本 高 Intelligence Index 版本、Cost per Task、TTFT、输出速度。第三方独立复测,口径统一、可追溯
LiveBenchlivebench.ai 每月更换题目的客观题基准 高 Reasoning、Data Analysis 分项。题目持续更新,是当前防污染做得较好的基准之一
OpenCompass 司南rank.opencompass.org.cn 中文与多模态能力的综合客观评测 中高 中文榜、多模态榜、能力雷达图的短板项。国内较权威,但部分子集长期固定,存在被针对性优化的空间
OpenRouter 用量榜openrouter.ai/rankings 开发者真金白银消耗掉的 token 量 高 New & Trending、周榜的持续走势(而非单日冲高)。花的是自己的钱,难以刷
GitHub / HF / 魔搭开源生态 开源生态的适配进度与下载趋势 中 主流推理框架的合并 PR、第三方量化是否跟进。下载量可被镜像和批量脚本注水
Reddit / X 一手反馈r/LocalLLaMA 等 真实提示词下的翻车案例 中 是否有多位独立用户复现同类失败。样本零散、带情绪,但常能最早暴露系统性问题

「客观题高分」和「实际好用」是两件事。客观基准看能力上限和稳定性,盲测看手感与表达,市场用量看真实场景能否跑通;三者不能互相替代,任何单一来源都不足以支撑结论。

第三部分30 分钟快速初筛标准作业程序

新模型发布后,不必等评测机构出长文,按下面五步走,30 分钟左右能拿到一轮带风险标注的初筛结论。

顺序说明:五步按「去哪儿找信息」组织,与第一部分的层级链路并不完全对应。比如工程指标要等 Artificial Analysis 收录后才有,通常晚于社区热度,不必纠结先后。

官方规格摸底

官方博客huggingface 模型卡modelscope 模型卡
  1. 打开官方博客或 huggingface / modelscope 模型卡,下载技术白皮书存好。Step 4 要拿它的数字和 LiveBench 对照。
  2. 确认模型类型:Base(基座)/ Instruct(指令对齐)/ Reasoning(推理)。类型不同,能直接对比的榜单也不一样;拿 Instruct 的总分去比推理模型的总分,结论会偏。
  3. 记录硬规格:上下文窗口上限、API 每百万 Token 输入 / 输出单价、License 是否允许商用。许可证不允许商用,或上下文撑不住你的输入长度,后面几步就不用看了。

看真人盲测与中文表现

arena.ai
  1. 打开 arena.ai,查看新模型的 Elo 排名。
  2. 别只看总榜:用 Filters 与同档位竞品横向对比,重点看 Hard Prompts(复杂指令与逻辑上限)、Coding、Chinese 三个分榜。
  3. 总榜排名要连置信区间一起读:区间过宽(通常刚发布、投票量不够)时,结论里注明「样本量不足,排名暂不稳定」,别把它当成确定的名次。

算工程性价比

artificialanalysis.ai
  1. 打开 artificialanalysis.ai,搜索该模型。
  2. 在 Intelligence vs Cost 散点图上确认位置:是否落在 Pareto Frontier(同等智能里价格最低,或同等价位里智能最高)。同时看 Cost per Task:推理型模型输出更长,实际每次任务的支出常高于用单价直接乘出来的估算,这个指标比 token 单价更接近真实账单。
  3. 检查工程性能指标:TTFT(首字延迟)与输出速度 Output Tokens/s 是否满足线上业务的延迟要求。

用独立基准交叉验证

livebench.airank.opencompass.org.cn
  1. 打开 livebench.ai,看最新一期题目里的成绩,重点看 Reasoning 与 Data Analysis。这个榜每月换题,相对不容易靠刷旧题拿高分。
  2. 拿 LiveBench 的分数跟 Step 1 里官方报告的数字对一遍:官方成绩亮眼、LiveBench 却明显落后,就在报告里标记「疑似评测集污染,高分低能」。这是整个 SOP 里最关键的一次交叉验证。
  3. 需要评估中文本土化或多模态落地时,再打开 rank.opencompass.org.cn,看司南榜单的能力雷达图,重点找短板项而不是看总分。

看生态热度与真实翻车记录

openrouter.ai/rankingsGitHubr/LocalLLaMA · X
  1. 打开 openrouter.ai/rankings,看 New & Trending 里的位置:有没有独立开发者在用自己的钱调用它。
  2. 开源模型去 GitHub 搜模型名,看 vLLM、SGLang、Ollama 等仓库的 Pull Requests:主流推理框架有没有很快合入架构适配。只有权重、没有推理框架支持,落地成本会明显上升。
  3. 到 Reddit r/LocalLLaMA 或 X 搜「模型名 + fail / hallucination / bug」,找真实提示词下的失败案例。注意区分两类反馈:多人独立复现的同一类失败是系统性问题,单条吐槽可能只是提示词没写好。

这 30 分钟得到的是初筛,不是终审。它足以排除明显注水或明显不匹配的候选,但最终选型还要补上真人盲测和自己业务提示词的私有评测。

第四部分带模板的提示词(复制即用)

下面这段提示词可直接粘给任意大模型,让它按同一套口径帮你补全调研卡片。提示词里已内嵌卡片模板,模型会按模板逐项回填,不用你自己拼。

research-card · AI MODEL RESEARCH CARD PROMPT
你是一名 AI 模型选型分析师。请对模型【模型名称/版本】做一次公开信息交叉验证,并严格按下面给出的卡片模板输出一份 AI MODEL RESEARCH CARD;模板中的每一项都要填上,不要增删字段顺序。

核对来源(只使用可公开查证的信息):
1. LMArena(arena.ai):总分榜与 Coding / Hard Prompts / 中文分榜排名、票数、置信区间。
2. Artificial Analysis:智能指数(写明版本)、Cost per Task、Output Tokens/s、TTFT。
3. LiveBench:Reasoning 与 Data Analysis 分项得分。
4. OpenCompass 司南:中文榜与多模态榜排名。
5. OpenRouter 用量榜:Today / Week / Trending 位置与走势。
6. 需要时补充 Arena-Hard v2 得分,以及开源模型的 HF / 魔搭下载趋势、第三方量化与推理框架适配情况。

填写要求:
1. 每个数字后面标注来源平台和查询日期;查不到的项写「未查到」,不要推测,也不要留空。
2. 官方自报成绩与第三方复测结果存在明显落差的指标,单独列出来并说明落差在哪里。
3. 第 5 项判定只能从「降本平替型 / 能力突破型 / 营销刷榜型」中选择,可以都不选,但必须说明理由。
4. 卡片之后,另附三到五条这份结论中最不确定的地方,供人工复核。

输出模板:

─────────────────────────────────────────────
AI MODEL RESEARCH CARD
─────────────────────────────────────────────

【1. 基础规格、合规与技术背景】
模型名称/版本:            发布组织:
开源协议 (License):       总参数 / 激活参数 (MoE):
上下文窗口 (Context):     原生能力: [ ]Thinking  [ ]Tool-Calling  [ ]多模态
技术白皮书质量: [ ]优秀(消融实验详实)  [ ]一般(无技术细节,仅营销稿)
API 每百万 Token 价格: 输入 $______ / 输出 $______

【2. 能力与手感验证】
LMArena 排名 / Elo:            核心分榜 (Coding / Hard Prompt / 中文):
LiveBench 推理 / 数据分析得分:  Arena-Hard v2 得分:
OpenCompass 综合 / 中文排名:    防污染结论: [ ]一致  [ ]疑似刷榜/过拟合

【3. 工程落地与用量】
Artificial Analysis 智能指数(版本):
输出速度 (Tokens/s) / 首字延迟 (TTFT):
Cost per Task:                 是否落在 Pareto Frontier:
OpenRouter 消耗量排名 (Today / Week / Trending):

【4. 生态集成度(仅开源权重模型)】
HF / 魔搭 近期下载趋势:        第三方量化 (GGUF/AWQ) 丰富度:
工程后端适配: [ ]vLLM  [ ]SGLang  [ ]Ollama  [ ]llama.cpp

【5. 综合判定(可多选)】
- [ ] 降本平替型:能力没有突破,但靠极低单价或极高速度,在性价比前沿线上胜出。
- [ ] 能力突破型:刷新了 Hard Prompts、LiveBench 等榜单的上限,有可验证的推理或 Agent 长板。
- [ ] 营销刷榜型:官方数据亮眼,LiveBench 上掉队,OpenRouter 用量一周后高开低走。

填卡备注:
- 白皮书只有营销稿、没有技术细节时,第 5 项结论必须加重「待人工验证」的标注。
- 本卡片是公开信息交叉验证的初筛结论,不能替代自己业务提示词上的私有评测。

─────────────────────────────────────────────