跳转到内容

评估工具箱

评估是 FDE 面试的分水岭——模块 5 我们学过,会调 API 的人一抓一大把,但能把“我的 RAG 到底好不好”讲清楚、给出量化指标和门禁流程的人极少。能不能上生产、敢不敢让客户付钱,全看评估这一关。下面这套工具按“三件套各管一段”来记:RAGAS 把 RAG 链路门禁住、Promptfoo 把提示词红队一遍、Langfuse 把线上一切可观测起来,再配上 DeepEval 做 CI gate、LangSmith/Phoenix 兜底,基本覆盖 FDE 现场的全部评估需求。

工具 链接 定位 备注
RAGAS github.com/explodinggradients/ragas RAG 评估首选 faithfulness / relevancy 等指标的事实标准
DeepEval github.com/confident-ai/deepeval CI gate 首选 pytest 风格,接 CI/CD 顺滑
Promptfoo github.com/promptfoo/promptfoo(已被 OpenAI 收购) 红队首选 批量对抗测试 + 多模型对比
Langfuse github.com/langfuse/langfuse 可观测首选 开源、可自托管,数据不外流
LangSmith smith.langchain.com LangChain 官方 与 LangChain/LangGraph 深度集成
Arize Phoenix github.com/Arize-ai/phoenix ML 级评估严谨度 tracing + 评估一体化,源自 Arize

三件套各管一段,先用开源。 RAGAS 做 RAG 离线评估(模块 4 配套)、Promptfoo 做提示词红队(模块 5 配套)、Langfuse 做线上可观测(模块 6 配套)——这三者都是开源、可自托管,组合起来就是一套完整评估闭环,且数据能留在自己手里,这是 FDE 在国内合规场景最常上的组合。

RAG 评估优先 RAGAS。 faithfulness(忠实度)、answer_relevancy(相关性)、context_precision/recall 这套指标已经成为 RAG 行业事实标准,客户和面试官都听得懂。把 RAGAS 跑出来的分数写进周报,就是把“我觉得还行”变成“我有据可依”。

CI gate 选 DeepEval。 它用 pytest 风格写断言,跟现有 CI/CD 丝滑集成,把“回归测试”概念从传统软件搬到 LLM 应用,模块 5 讲的“评估即门禁”用它能直接落地。

红队与提示词对抗选 Promptfoo。 它已被 OpenAI 收购,后续与 OpenAI 生态会更紧。批量跑 N 个对抗 prompt、横向对比多个模型/多版提示词的能力,是上线前最后一道安全网。

可观测优先 Langfuse(开源自托管),深度绑定 LangChain 选 LangSmith。 线上 trace、token 成本、链路延迟、用户反馈,这些必须在线上才能看见的东西,Langfuse 是开源首选,合规友好;如果你的应用本就架在 LangChain/LangGraph 上,LangSmith 接入成本最低。Arize Phoenix 适合对评估严谨度要求到 ML 工程级别的团队,tracing + 评估一体化做得最重。