LLM 评测体系:从离线判分到在线回归

系统覆盖 LLM 应用评测工程的全链路。

每一个上线了 LLM 功能的团队,都会在某个深夜遇到同一个问题——"昨天还好好的,今天怎么效果就变了?" 模型升级了一个版本,prompt 多加了一句话,retriever 改了 chunk 大小,向量库换了索引参数。每一处改动都"看起来更好",但真实质量到底是涨了还是跌了?没人说得清。

这种"凭感觉调 LLM"的工程模式,在 2023 年是普遍现象,到 2026 年已经成为生产事故的最大单一来源。Air Canada 的退款 chatbot 因为一句幻觉赔了真金白银;Google Bard 在发布会上一句事实错误蒸发市值千亿;OpenAI、Anthropic 因模型版本静默退化被开发者反复声讨——所有这些事故,本质都是同一件事:LLM 应用上线后,再也没有人知道它到底好不好。

测试软件工程师靠的是断言——assert result == expected。LLM 工程师不能这么干,因为模型输出每次都不一样,"对"也不止一种说法。这就是为什么所有传统的 CI / 单测体系到了 LLM 这一层全部失效,必须重建一整套从数据集设计、判分方法、统计推断到在线监控的工程范式。这套范式有一个统一的名字——Evals

本专栏拆解的就是这套范式。从最基础的"如何写一条规则判分",到 LLM-as-Judge 的偏差校准,再到 ragas、promptfoo、lm-evaluation-harness 这些开源框架的源码工程学;从离线评测的数据集冷启动,到 CI 里把 Evals 变成质量门禁;从 RAG 的 Faithfulness 度量,到 Agent 的 Trajectory 评估,再到多轮对话与安全对齐的专项评测。

读完本专栏,你会知道:你的 LLM 应用每一次改动的真实效果——而不是猜的。

flowchart TB
  subgraph OFF [离线评测]
    direction LR
    DS[数据集工程<br/>冷启动 · 分层 · 防污染] --> GR
    subgraph GR [判分]
      direction TB
      R[规则判分] --- J[LLM-as-Judge<br/>偏差校准] --- H[人工评测]
    end
    GR --> MT[Meta-Eval<br/>判分器本身准不准]
  end
  MT --> CI[CI 质量门禁<br/>每次改动都过一遍]
  CI --> ON[在线监控<br/>回归 · 漂移 · 告警]
  ON -.真实样本回流.-> DS
  GR -.专项.-> SP[RAG · Agent · 多轮 · 安全]

这条链路里最容易被跳过的是 Meta-Eval。 大多数团队搭完 LLM-as-Judge 就以为有评测了——但如果没人评过这个 judge 本身,你只是把"凭感觉"换成了"凭另一个模型的感觉"。第 8 章专门讲怎么给判分器打分。

读完你能做到什么

  1. 从零建一个能用的评测集。 冷启动策略、分层设计、难例挖掘、防污染,以及数据集怎么随业务演进(第3章 数据集工程)。
  2. 选对指标。 哪些指标在什么场景下有意义、哪些是自欺欺人,以及统计显著性——两次跑分差 2% 到底算不算改进(第4章 指标)。
  3. 写出三类判分器并知道各自的边界。 规则判分、LLM-as-Judge 的偏差与校准、人工评测的组织方式(第5章 规则判分第6章 LLM-as-Judge第7章 人工评测)。
  4. 评估你的评估。 Meta-Eval:判分器与人类判断的一致性怎么量、偏了怎么修(第8章 Meta-Eval)。
  5. 读懂主流开源框架的设计取舍。 OpenAI Evals、lm-evaluation-harness、ragas、promptfoo 各自的抽象与适用面(第9章第10章第11章第12章)。
  6. 做专项评测。 RAG 的 Faithfulness、Agent 的 Trajectory、多轮对话、安全对齐(第13章 RAG 评测第14章 Agent 评测第15章 多轮第16章 安全)。
  7. 把评测接进 CI,变成门禁。 什么该拦、什么只该告警、跑多久算可接受,以及在线平台怎么选(第17章 在线平台第18章 CI 质量门禁)。

适合谁读

前置阅读:本专栏假设读者已经写过 LLM 应用代码(至少调过 OpenAI / Anthropic API),理解 prompt、retriever、tool calling 的基本概念。如果你还在 LLM 入门阶段,建议先读本系列的《LangChain 工程实战》《RAG 工程与检索系统设计》。

目录

第一部分:为什么需要评测

第二部分:评测理论基础

第三部分:判分方法学

第四部分:开源框架源码剖析

第五部分:场景化评测实战

第六部分:生产化与持续评测

源码版本与数据来源

本专栏所有源码引用、性能数字、实验结论均基于以下版本和公开来源(2026 年 4 月 27 日锁定):

项目 版本 / Commit 引用范围
openai/evals 4bfc1f5 (2025-11-03) 第 9 章
EleutherAI/lm-evaluation-harness v0.4.5 第 10 章
explodinggradients/ragas v0.2.10 第 11、13、14、15 章
promptfoo/promptfoo 0.106.0 第 12、18 章
langchain-ai/langsmith-sdk 0.3.1 第 17 章
langfuse/langfuse v3.45.0 第 17 章
Arize-ai/phoenix 7.5.1 第 17 章

学术 benchmark 与论文引用:MMLU (Hendrycks et al. 2021, arXiv:2009.03300)、MT-Bench (Zheng et al. 2023, arXiv:2306.05685)、Arena Hard (Li et al. 2024)、HELM (Liang et al. 2023, arXiv:2211.09110)、ragas 论文 (Es et al. 2023, arXiv:2309.15217)、G-Eval (Liu et al. 2023, arXiv:2303.16634)、JudgeBench、TruthfulQA、HaluEval。

行业事故与公开数据:Air Canada v. Moffatt (2024 BCCRT 149)、Google Bard demo 事件、ChatGPT 退化争议(公开 GitHub Issue / Reddit / arXiv:2307.09009)、Anthropic / OpenAI 官方 model deprecation 公告。

读者可通过仓库 git clone 命令获取与本专栏完全一致的源码:

git clone https://github.com/openai/evals.git
git clone https://github.com/EleutherAI/lm-evaluation-harness.git
git clone https://github.com/explodinggradients/ragas.git
git clone https://github.com/promptfoo/promptfoo.git
git clone https://github.com/langchain-ai/langsmith-sdk.git
git clone https://github.com/langfuse/langfuse.git
git clone https://github.com/Arize-ai/phoenix.git

本专栏与其他卷的关系

本专栏是杨艺韬讲堂"AI 工程化"系列的第七卷,与以下卷形成知识网络:

版权声明

本专栏内容为 杨艺韬 版权所有,保留一切权利。未经书面许可,不得全文或大段转载、改编、翻译,或用于任何商业用途(含以本专栏内容训练模型、生成衍生课程或商品)。

欢迎分享本专栏的链接。引用少量内容用于评论、教学或研究时,请署名 杨艺韬 并附上原文链接。