DeepEval LLM评估框架:5分钟跑通第一次模型质量测试 DeepEval LLM评估框架5分钟跑通第一次模型质量测试【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepevalDeepEval 是一个开源的LLM 评估框架把大模型输出当成可测试对象写测试用例、用 40 余个内置指标打分并能接入 CI。适合需要系统化验证 LLM 应用质量的 AI 工程师与开发者。它解决什么问题DeepEval 解决一个具体问题用“测试”代替“凭感觉”来评估模型。以下三类情况最适合引入它RAG 知识库换模型或调整检索后回答质量会悄悄变化需要客观分数判断好坏。客服对话机器人坏例子靠人工抽查追不上需要固定指标的回归测试在质量下滑时给出信号。Agent 工具调用智能体可能选错工具或陷入循环需要对调用链做量化检查而不只看最终回答。安装并完成第一次评估需要 Python 3.9一条命令完成安装pip install deepeval再写一个 pytest 风格的测试文件仓库里已有可直接参考的示例 examples/getting_started/test_example.pyfrom deepeval import assert_test from deepeval.metrics import AnswerRelevancyMetric from deepeval.test_case import LLMTestCase def test_answer_relevancy(): test_case LLMTestCase( inputWhat if these shoes dont fit?, actual_outputWe offer a 30-day full refund., expected_outputFree full refund within 30 days., ) metric AnswerRelevancyMetric(threshold0.7) assert_test(test_case, [metric])执行deepeval test run test_example.py终端会给出每个用例的通过/失败与得分。若还需要可视化看板、标注与团队协作可接入 Confident AI 平台支持与编码工具通过 MCP 对接核心能力从数据集到回归数据集管理deepeval/dataset/EvaluationDataset批量组织测试用例Goldens 支持版本管理可导入导出 CSV/JSON。评估执行deepeval/evaluate/evaluate()本地跑完整数据集并按指标打分内置 pytest 插件可直接挂进 CI。追踪deepeval/tracing/基于 OpenTelemetry 记录每次 LLM 与工具调用为 span失败用例可定位到具体环节。对话模拟deepeval/simulator/用 LLM 扮演“用户”与机器人多轮对话把对话结果沉淀为回归数据集。 指标体系一次看懂内置指标指标实现集中在 deepeval/metrics/按场景选取即可指标评估内容AnswerRelevancyMetric回答与问题的相关程度FaithfulnessMetric回答是否以给定参考资料为依据ContextualRelevancyMetric检索到的上下文与问题的相关性ContextualRecallMetric参考资料是否覆盖期望答案要点HallucinationMetric资料中无依据的编造内容SummarizationMetric摘要对原文的忠实度ToxicityMetric/BiasMetric有害内容与偏见PIILeakageMetric是否泄露个人信息GEval用自然语言自定义任意评分标准DAGMetric结构化多步评分子标准树ToolUseMetric工具选择与调用参数是否正确ConversationCompletenessMetric多轮任务是否达成目标ExactMatchMetric/PatternMatchMetric规则匹配无需调用 LLM规则类指标如ExactMatchMetric不需要裁判模型GEval这类 LLM 指标需配置裁判模型本地或商用模型均可。三个最有价值的落地场景RAG 知识库问答用 ContextualRelevancy ContextualRecall Faithfulness 三件套区分“检索差”和“生成差”测试集固定只改检索参数或模型直接对比得分加HallucinationMetric拦截无依据回答每次回归都能得到新旧用例的逐项对比视图客服多轮对话ConversationCompletenessMetric检查对话目标是否达成用 ConversationSimulator 自动生成用户问题减少人工造例Turn 级忠实度指标跟踪单轮质量回退Agent / MCP 工具调用ToolUseMetric检查工具选择与参数AgentLoopDetectionMetric识别无限循环MCPTaskCompletionMetric评估端到端任务完成度LangChain、CrewAI 等框架如何接入deepeval/integrations/ 目录提供了主流框架的插桩集成LangChain / LangGraph自动捕获链与节点为评估轨迹LlamaIndex观察 RAG 中检索与生成各步骤OpenAI Agents / Pydantic AI / CrewAI记录智能体编排全过程Google ADK / Strands把 Agent 应用接入同一评估管线Anthropic / OpenAI SDK补丁式自动追踪代码改动最小 进阶源码目录与评估策略指标实现deepeval/metrics/测试用例定义deepeval/test_case/官方文档入口docs/content/docs/getting-started.mdxCI 用法docs/content/docs/evaluation-unit-testing-in-ci-cd.mdx制定评估策略的建议先用 10~30 条线上真实问题建基线数据集并为每个指标设定通过阈值每次改 prompt 或换模型都跑一次回归评估低于阈值即告警把失败用例当 bug 处理沿调用链定位问题出在检索、生成还是工具调用定期把线上坏例子回流进数据集让测试集随业务演进❓ 常见疑问评估本身需要调用 LLM 接口吗规则类指标如ExactMatchMetric不需要AnswerRelevancyMetric、GEval等基于 LLM 的指标需要配置裁判模型本地或商用模型均可。业务数据必须上云吗核心评估在本地执行数据可以不出你的环境。Confident AI 平台是可选组件用于可视化、标注与协作。如何在 CI 中运行DeepEval 注册为 pytest 插件可直接用deepeval test run也可以像普通pytest一样运行失败即阻断构建。自定义评估标准要写代码吗GEval直接用自然语言描述标准并指定评估参数即可需要更严格结构时用DAGMetric把标准拆成子标准树。动手试试从你的应用里挑一条真实问题写进测试用例跑一遍。完整文档见 docs/content/docs/getting-started.mdx指标源码在 deepeval/metrics/。【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

最新新闻

轻量跨平台SQL客户端Beekeeper Studio实战指南

轻量跨平台SQL客户端Beekeeper Studio实战指南

简介:这是一款面向数据库开发与运维人员的跨平台 SQL 客户端,基于 Electron 构建,支持 MySQL、PostgreSQL、SQLite、SQL Server 等主流数据库,覆盖 Linux、macOS 与 Windows 三大系统。压缩包共 290 个文件,大小约 40.…

2026/9/9 15:57:01
老 Intel Mac 升级 macOS 完整指南:四步让 Big Sur 到 Sequoia 跑起来(免费工具 OpenCore Legacy Patcher 实操教程)

老 Intel Mac 升级 macOS 完整指南:四步让 Big Sur 到 Sequoia 跑起来(免费工具 OpenCore Legacy Patcher 实操教程)

老 Intel Mac 升级 macOS 完整指南:四步让 Big Sur 到 Sequoia 跑起来(免费工具 OpenCore Legacy Patcher 实操教程) 【免费下载链接】OpenCore-Legacy-Patcher Experience macOS just like before 项目地址: https://gitcode.com/GitHub_T…

2026/9/9 15:57:01
跨年度干旱重创亚马逊雨林:遥感证据与碳汇逆转

跨年度干旱重创亚马逊雨林:遥感证据与碳汇逆转

1. 为什么我盯上了这篇文献:选文逻辑与第一印象先说一个背景:我是搞植被遥感与全球变化生态学方向的,平时追踪文献有个习惯,凡是标题里带着“Unprecedented”(前所未有)这种词的,我一律先保持三…

2026/9/9 15:57:01
SpringBoot+Vue图书管理系统:从数据库设计到前后端部署全解析

SpringBoot+Vue图书管理系统:从数据库设计到前后端部署全解析

最近后台收到好多读者留言,问学生项目或者课设到底怎么选技术栈,SpringBoot 和 SSM 有什么区别,前后端分离的项目怎么联调。正巧我自己手上完整跑过一个“基于 SpringBoot Vue 的图书管理系统”,从数据库设计到后端接口&#xff…

2026/9/9 15:57:01
如何暂停 AltriumDesign 中的 Remove Loop 的功能?

如何暂停 AltriumDesign 中的 Remove Loop 的功能?

【暂停AD中的去重功能】Altium Designer 暂停 Remove Loop(自动移除回路)功能全称:Automatically Remove Loops,布线时新走线接回原有走线,自动删掉旧走线形成的多余环路。✅ 方式1:布线中临时切换&#xf…

2026/9/9 15:57:01
网络安全——kali中的set工具

网络安全——kali中的set工具

一、kali中的set工具利用的是社会工程学攻击 二、常见的社会工程学: 环境渗透、引诱、伪装欺骗、说服、恐吓、恭维、反向社会工程学 三、SET工具的使用1、建立钓鱼网站收集目标凭证 (1)、打开set:有两种途径(2&#xf…

2026/9/9 15:52:01