评估工具箱
评估是 FDE 面试的分水岭——模块 5 我们学过,会调 API 的人一抓一大把,但能把“我的 RAG 到底好不好”讲清楚、给出量化指标和门禁流程的人极少。能不能上生产、敢不敢让客户付钱,全看评估这一关。下面这套工具按“三件套各管一段”来记:RAGAS 把 RAG 链路门禁住、Promptfoo 把提示词红队一遍、Langfuse 把线上一切可观测起来,再配上 DeepEval 做 CI gate、LangSmith/Phoenix 兜底,基本覆盖 FDE 现场的全部评估需求。
| 工具 | 链接 | 定位 | 备注 |
|---|---|---|---|
| RAGAS | github.com/explodinggradients/ragas | RAG 评估首选 | faithfulness / relevancy 等指标的事实标准 |
| DeepEval | github.com/confident-ai/deepeval | CI gate 首选 | pytest 风格,接 CI/CD 顺滑 |
| Promptfoo | github.com/promptfoo/promptfoo(已被 OpenAI 收购) | 红队首选 | 批量对抗测试 + 多模型对比 |
| Langfuse | github.com/langfuse/langfuse | 可观测首选 | 开源、可自托管,数据不外流 |
| LangSmith | smith.langchain.com | LangChain 官方 | 与 LangChain/LangGraph 深度集成 |
| Arize Phoenix | github.com/Arize-ai/phoenix | ML 级评估严谨度 | tracing + 评估一体化,源自 Arize |
三件套各管一段,先用开源。 RAGAS 做 RAG 离线评估(模块 4 配套)、Promptfoo 做提示词红队(模块 5 配套)、Langfuse 做线上可观测(模块 6 配套)——这三者都是开源、可自托管,组合起来就是一套完整评估闭环,且数据能留在自己手里,这是 FDE 在国内合规场景最常上的组合。
RAG 评估优先 RAGAS。 faithfulness(忠实度)、answer_relevancy(相关性)、context_precision/recall 这套指标已经成为 RAG 行业事实标准,客户和面试官都听得懂。把 RAGAS 跑出来的分数写进周报,就是把“我觉得还行”变成“我有据可依”。
CI gate 选 DeepEval。 它用 pytest 风格写断言,跟现有 CI/CD 丝滑集成,把“回归测试”概念从传统软件搬到 LLM 应用,模块 5 讲的“评估即门禁”用它能直接落地。
红队与提示词对抗选 Promptfoo。 它已被 OpenAI 收购,后续与 OpenAI 生态会更紧。批量跑 N 个对抗 prompt、横向对比多个模型/多版提示词的能力,是上线前最后一道安全网。
可观测优先 Langfuse(开源自托管),深度绑定 LangChain 选 LangSmith。 线上 trace、token 成本、链路延迟、用户反馈,这些必须在线上才能看见的东西,Langfuse 是开源首选,合规友好;如果你的应用本就架在 LangChain/LangGraph 上,LangSmith 接入成本最低。Arize Phoenix 适合对评估严谨度要求到 ML 工程级别的团队,tracing + 评估一体化做得最重。