yao-meta-skill - output-eval-method 输出评估方法输出评估实验室Output Eval Lab证明技能是否改善了最终面向用户的结果而不仅仅是路由是否正确。何时使用对生产Production、库Library、受治理Governed或团队分发的技能使用输出评估。脚手架Scaffold技能可以用一个冒烟用例起步但生产级及以上在推广之前应该展示出带技能相对基线的正向信号。用例设计每个用例应该包括一个真实的提示词或任务形态任何必需的输入文件一个代表不使用技能完成任务时的基线输出一个代表技能引导行为的带技能输出可以在没有主观猜测的情况下检查的断言可选的用于品味、完整性或判断力的人工审查备注断言规则优先选择能捕捉实质性质量的断言必需的交付物路径必需的部分或契约必需的边界或排除性语言必需的证据路径禁止的通用占位符禁止的不安全操作避免只奖励措辞记忆的断言。如果一个用例可以通过复述一句话就通过却在真实工作中失败那么这个断言就太窄了。得分解读第一份 v0 记分卡报告基线通过率带技能通过率绝对差值失败的断言和失败分类当生成了reports/output_execution_runs.md时的执行模式、计时和 token 证据盲 A/B 评审包数量推荐的下一步修复生产推广应要求带技能通过率超过基线并解释每一个失败的断言。执行证据在记分卡之后运行执行证据python3 scripts/yao.py output-exec默认情况下这会记录当前用例的输出作为recorded_fixture。这对可复现性有用但它不是模型执行的证据。要收集真实的运行证据请传入--runner-command并附上命令或 JSON 字符串列表。运行器从 stdin 接收 JSON 请求并应返回包含以下内容的 JSONoutput可选的execution_kindcommand或model可选的provider和model可选的usage.input_tokens、usage.output_tokens和usage.total_tokens只有返回 provider/model 元数据或execution_kind: model的运行才应算作模型执行的。如果缺少 token 用量报告可以估算 token但估算必须标注为估算值。对于没有外部模型凭据的本地发布门槛冒烟证据使用确定性运行器python3 scripts/yao.py output-exec --runner-command[python3,scripts/local_output_eval_runner.py]这会验证命令运行器契约、计时捕获、评分路径和失败处理。它绝不能被描述为基于提供商的模型证据。对于基于提供商的证据使用带真实凭据的捆绑提供商运行器YAO_OUTPUT_EVAL_MODELgpt-4.1-mini\OPENAI_API_KEY...\python3 scripts/yao.py output-exec --provider-runner openai提供商运行器调用与 OpenAI Responses API 兼容的端点读取相对于evals/output/的输入文件返回execution_kind: model并在提供商返回用量字段时记录观察到的 token 用量。如果 API 密钥或模型缺失运行器必须失败而不是回退到固定夹具或假装存在模型证据。只有经过审查的兼容端点才使用--provider-base-url非默认的 HTTPS 主机需要--allow-custom-base-url而纯 HTTP 只允许与--allow-insecure-localhost一起用于本地测试服务器。盲 A/B 评审每次输出评估运行还应该生成reports/output_blind_review_pack.mdreports/output_blind_review_pack.jsonreports/output_blind_answer_key.json评审包必须隐藏变体 A 或变体 B 来自基线还是技能引导输出。答案密钥是独立的审计证据只有在评审者做出判断之后才能打开。评审者裁定盲审之后在reports/output_review_decisions.json中记录评审者的选择包含reviewer、reviewed_at、winner_variant、可选的confidence以及必需的基于评分标准的reason然后运行python3 scripts/adjudicate_output_review.py --write-template python3 scripts/yao.py output-review裁定报告写入reports/output_review_decisions.jsonreports/output_review_adjudication.jsonreports/output_review_adjudication.md当没有评审者决定时报告应说明用例处于待定状态Review Studio审查工作室应链接到决定模板。不要把待定用例算作人工一致。只有带评审者元数据和非空reason的真实winner_variantA或B才应计入一致率、分歧数和评审者判断数。裁定报告必须保持盲审完整性待定和无效的决定应显示预期的胜者为隐藏状态。只有在某个用例存在带理由的有效评审者决定之后才揭示expected_winner_variant。防过拟合保留一个小的公开冒烟集和一个独立的留出集。把真实的失败轮换进分类体系而不是只修改失败的提示词。每当输出看起来不错但边界仍然不清晰时就添加近似邻居用例。

相关新闻

最新新闻

用Plotly+Dash打造交互式数据仪表盘:从入门到实战避坑指南

用Plotly+Dash打造交互式数据仪表盘:从入门到实战避坑指南

做数据看板这三年,我前前后后换过好几种方案。最开始用 Excel 透视表硬扛,后来试过 Power BI 拖拽,再后来还写过 Flask ECharts 的前后端分离页面,但直到换成 Plotly Dash 组合,才算找到了一个既能快速交付、又能把交…

2026/9/8 1:19:21
DWD层数据装载:首日与增量脚本实战解析

DWD层数据装载:首日与增量脚本实战解析

1. 项目概述 在数据仓库建设过程中,DWD(Data Warehouse Detail)层作为数据仓库的核心层,承担着对原始数据进行清洗、转换和整合的重要职责。尚硅谷大数据课程中的数仓搭建实践,为我们提供了一个完整的工业级数据仓库建设范例。本文将重点解析…

2026/9/8 1:19:21
HDFS Java API核心功能与实战优化指南

HDFS Java API核心功能与实战优化指南

1. HDFS Java API核心功能全景图作为Hadoop生态系统的基石文件系统,HDFS提供了完整的Java API体系。这些API按照功能维度可划分为六个核心模块:文件系统交互类:FileSystem作为入口类,提供open(),create(),append()等基础文件操作方…

2026/9/8 1:19:21
Windows XP安装OpenCV 1.0

Windows XP安装OpenCV 1.0

双击图标,即可启动安装:同意License Agreement,这个和安装其它软件没有任何不同。选择安装的路径,默认为C:\\Program Files\OpenCV,保持默认即可:默认即可:添加环境变量,非常重要&am…

2026/9/8 1:19:21
宽屏手机“看得更多“,我 16:9 的凭什么吃亏?

宽屏手机“看得更多“,我 16:9 的凭什么吃亏?

从一条三角函数公式,讲透射击游戏的多机型视野公平一、先说结论:这不是玄学,是一条公式的必然结果 打开 Unity,选中相机,你会看到一个 Field of View(视野角)。 关键的坑就在这里:Un…

2026/9/8 1:19:21
储能参与电力市场双层优化:现货与调频交易策略的Matlab实现

储能参与电力市场双层优化:现货与调频交易策略的Matlab实现

储能怎么赚钱,这事儿做电力系统优化的人基本都绕不开。单纯靠峰谷价差套利,算下来投资回报率往往不太好看——现货电能量市场的价格波动再大,一天也就几个高峰几个低谷,电池充放次数摆在那里,收益天花板很明显。所以业…

2026/9/8 1:14:21