GPT-5.6 Luna 降价 80%:Agent 真正该重算的是单次成功成本 GPT-5.6 Luna 降价 80%Agent 真正该重算的是单次成功成本TL;DR场景OpenAI 2026-07-30 公告 Luna Standard 短上下文四项费率同步降到旧价 20%即降价 80%同构 Luna Token 账单精确下降 80%。结论模型 Token 便宜不等于单次成功任务便宜。Agent 任务总成本还包含工具调用、循环重试、长上下文阶跃、缓存失配和人工复核真正决定迁移价值的是cost_per_success。产出完整费率等式4 项 × 0.2 工具成本拐点Web Search 0.01 示例 Token 0.0064 272K 长上下文阶跃2× 输入 / 1.5× 输出 缓存命中顺序建议 cost_per_success 公式与对照表 100-500 个真实任务 A/B 矩阵 Luna-first 三档条件升级方案 30 天迁移节奏。版本矩阵维度状态说明Luna Standard 短上下文四项费率同步降到旧价 20%✅ 已验证输入 1.00 → 0.20 / 缓存读 0.10 → 0.02 / 缓存写 1.25 → 0.25 / 输出 6.00 → 1.20美元 / 百万 Token等式new 0.20 × old✅ 已验证同 Luna 模型 / 同服务层级 / 同上下文区间 / 同 Token 向量Luna 上下文容量✅ 已验证1,050,000 token 上下文 / 128,000 最大输出272K 长上下文阶跃✅ 已验证输入 272K 后完整请求按 2× 输入 1.5× 输出费率计费Standard 对应输入 0.40 / 缓存读 0.04 / 缓存写 0.50 / 输出 1.80OpenAI 公告日期✅ 已验证自 2026-07-30 起 API 定价生效Sol 同时新增 Fast modeTerra 同步降价✅ 已验证Terra 同步降价 20%输入 $2/M、输出 $12/MWeb Search 固定调用费✅ 已验证$10.00 / 1k callsreasoning 与 non-reasoning 模型存在价差non-reasoning preview $25.00/1kWeb Search 内容 Token✅ 已验证搜索内容 Token 另计Container / Code Interpreter✅ 已验证每 20 分钟会话计费File search✅ 已验证Storage $0.10/GB-dayTool call $2.50/1k callsAgent Kit✅ 已验证ChatKit file/image upload storage $0.10/GB-day缓存读取 输入的 10%✅ 已验证Luna Standard缓存读 0.02 / 输入 0.20 10%缓存写入 普通输入✅ 已验证Luna Standard缓存写 0.25 / 输入 0.20 1.25×Luna-first 升级条件✅ 已验证失败 / 低置信 / 复杂任务升级高风险保留人工责任“模型 Token 便宜 任务总成本便宜”❌ 不成立工具、循环、人工摊销、272K 阶跃都独立计费“用 Benchmark 决定迁移”❌ 不成立必须用 100-500 个真实任务的 cost_per_success“Luna-only 替换全部任务”❌ 不成立高错误代价 / 难自动验证任务仍需 Terra/Sol 终审 人工“平均上下文 200K ≠ 成本稳定”❌ 不成立P50/P90/P95/P99 272K 阶跃 跨线前最后工具调用都要看“缓存写越多越好”❌ 不成立写后未读是浪费写在前缀会被复用时才有收益“新价 任意上下文任意 Token 统一”❌ 不成立272K 阶跃 缓存读 / 写 / 输入分别计价“Web Search 与模型 Token 一起降”❌ 不成立工具费单独计费固定调用费与 Token 价格不联动“Luna 自动验证 可去掉人工复核”❌ 不成立高风险决策保留人工责任文章正文GPT-5.6 Luna 降价 80%Agent 真正该重算的是单次成功成本事实边界本文按 2026-07-31 可访问的 OpenAI 公告、Luna 模型卡与 API 价格页核验。降价不代表模型权重改变也不能推导 OpenAI 的单位推理成本或毛利率。摘要Luna Standard 短上下文输入、缓存读取、缓存写入和输出价格都降到了旧价的 20%。所以在模型、服务层级、上下文区间和 Token 构成不变时模型 Token 账单精确下降 80%。但 Agent 任务还包含工具调用、循环重试、长上下文阶跃、缓存失配和人工复核。真正决定迁移价值的指标应是cost_per_success。本文给出完整费率等式、工具成本拐点、272K 阈值、100–500 个真实任务 A/B 和 Luna-first 条件升级方案。关键词GPT-5.6 Luna、cost_per_success、272K 阈值、Web Search、Luna-first目录一、80% 是严格等式但有四个前提二、模型费降 80%任务总成本为什么未必三、Token 便宜后工具更早成为成本中心四、272K 是完整请求的离散价格阶跃五、缓存命中属于计费架构六、迁移主指标cost_per_success七、用 100–500 个真实任务做 A/B八、Luna-first不是 Luna-only九、30 天迁移节奏结论参考资料一、80% 是严格等式但有四个前提OpenAI 当前列示的 Luna Standard 短上下文费率为计费项旧价新价单位未缓存输入1.000.20美元/百万 Token缓存读取0.100.02美元/百万 Token缓存写入1.250.25美元/百万 Token输出6.001.20美元/百万 Token设四类 Token 分别为I、R、W、Oold 1.00I 0.10R 1.25W 6.00O new 0.20I 0.02R 0.25W 1.20O 0.20 × old这条等式只在四个条件同时成立时有效同一个 Luna 模型、同一服务层级、同一上下文费率区间、同一 Token 向量。工具、区域与第三方费用不包含在等式中。二、模型费降 80%任务总成本为什么未必Agent 任务成本至少包含模型 Token 工具调用 外部服务 重试与循环 人工复核假设旧模型 Token 成本 0.10 美元工具 0.03 美元人工复核摊销 0.07 美元总成本是 0.20 美元。模型部分降 80% 后总成本变成0.02 0.03 0.07 0.12 美元业务总成本只下降 40%。如果 Luna 需要更多轮次、搜索或人工介入单次调用更便宜单次成功任务甚至可能没有更便宜。三、Token 便宜后工具更早成为成本中心OpenAI 当前 Web Search 固定调用费为每 1,000 次 10 美元即每次 0.01 美元搜索内容 Token 另计。一次 20K 未缓存输入、2K 输出的 Luna Standard 请求20K × $0.20/M 2K × $1.20/M $0.0064一次 Web Search 的固定费已经高于模型 Token 成本。这不是让 Agent 停止搜索而是要求团队记录tool_calls_per_success、重复搜索、无结果搜索和搜索后的成功率提升。该搜的证据仍要搜失控的循环必须被 Harness 截止。四、272K 是完整请求的离散价格阶跃Luna 支持 1,050,000 上下文最大输出 128,000但输入超过 272K 后完整请求按 2 倍输入、1.5 倍输出费率计费。Standard 对应变为输入 0.40、缓存读 0.04、缓存写 0.50、输出 1.80 美元/百万 Token。平均上下文 200K 不能证明成本稳定。团队需要看 P50/P90/P95/P99、跨线比例以及跨线前最后一次工具调用。可以在 240K–260K 预警并压缩已确认状态但高风险任务如果必须保留完整证据就应接受长上下文费率。五、缓存命中属于计费架构缓存读取价格是普通输入的十分之一但命中依赖稳定前缀。把时间戳、用户状态或最新工具结果放在 Prompt 前部会让后续稳定 instructions 无法复用。更合理的顺序是稳定 instructions 稳定工具定义 稳定任务规则 动态用户状态 最新工具结果 当前请求缓存写入价格高于普通输入。只有前缀会被复用时写入才可能有收益。因此需要同时观察读取率、写入率、前缀复用次数和写后未读比例。六、迁移主指标cost_per_success先为任务定义可验收的成功代码任务可要求测试、静态检查和补丁审计检索任务可要求关键结论带可访问来源结构化提取可要求 schema 与抽样共同通过。然后计算cost_per_success 所有尝试的模型费 所有工具费 外部服务费 人工复核摊销 -------------------------------- 成功任务数对照表至少包含首次成功率与严重错误数单次成功成本P50/P95 端到端延迟每次成功的重试、模型轮次、工具调用与输出 Token缓存读取率、人工复核分钟数和升级模型分布。七、用 100–500 个真实任务做 A/B样本应覆盖低风险可验证、中等不确定性、高错误代价、长上下文、重工具调用和历史尾部失败任务。在相同 Harness、工具预算和验证器下比较A当前生产路由 BLuna-first 相同验证器 条件升级通过条件不是平均分不错而是成功率在容差内、P95 未超预算、cost_per_success稳定下降、严重错误为 0且工具循环、人工复核和升级率没有异常上升。八、Luna-first不是 Luna-only低不确定性 可自动验证 高调用量 - Luna first 中等不确定性 用户可见 验收标准明确 - Luna / Terra A/B失败时升级 高不确定性 高错误代价 难自动验证 - Terra / Sol 规划终审Luna 执行可验证子任务升级条件应能被系统观察schema 或测试失败、来源冲突、置信不足、工具循环超限、长上下文接近阈值且不可安全压缩以及不可逆、财务、法律或安全风险。九、30 天迁移节奏第 1–3 天导出模型、工具、重试和人工复核基线统一成功定义。第 4–10 天低风险小流量对照每日核对本地估算和真实账单。第 11–20 天纳入中等不确定性和长上下文观察 P95 与尾部失败。第 21–30 天固化升级与回滚阈值高风险任务保留 Terra/Sol。任务量很小时维护多模型路由的工程成本可能高于节省金额继续使用单一强模型是合理的更简单方案。自动验证器也不能替代高风险任务中的人工责任。结论可以精确说同构 Luna Token 账单下降 80%。必须通过实验回答你的单次成功任务成本下降了多少。Luna 的新价格让大量可验证任务具备 Luna-first 的经济性但真正可持续的收益来自成功定义、工具预算、上下文治理、真实任务 A/B、条件升级和可回滚的运行合同。参考资料OpenAIGPT-5.6 价格性能公告OpenAI DevelopersGPT-5.6 Luna 模型卡OpenAI DevelopersAPI PricingOpenAIGPT-5.6 效率说明错误速查卡症状根因定位修复把模型 Token 账单降 80%当任务总成本降 80%工具 / 外部服务 / 重试 / 人工摊销独立计费检查 cost_per_success 公式各分量用 cost_per_success 替换单一模型费对比Web Search 突然成为成本中心工具固定调用费 模型 Token 费检查 tool_calls_per_success / 重复搜索 / 无结果搜索记录重复搜索与成功率提升用 Harness 截止失控循环长上下文任务超出预算输入 272K 后完整请求按 2× 输入 / 1.5× 输出费率检查 P50/P90/P95/P99 跨线比例在 240K-260K 预警并压缩高风险任务接受长上下文费率缓存命中仍偏低时间戳 / 用户状态 / 工具结果被放在稳定前缀前部检查 prompt 顺序稳定 instructions / 工具定义 / 任务规则 → 动态用户状态 → 最新工具结果 → 当前请求缓存写入后未读缓存写 普通输入只在前缀会被复用时才有收益检查写后未读比例观察读取率 / 写入率 / 前缀复用次数写后未读即浪费跑分高就宣布迁移Benchmark ≠ 真实任务Benchmark 不能覆盖工具循环 / 长上下文 / 错误代价缺少真实任务 A/B用 100-500 个真实任务做 A/B固定任务集、工具、重试规则与质量门槛“Luna-only” 替换全部任务高错误代价 / 难自动验证任务仍需 Terra/Sol 终审任务分类表Luna-first 三档低不确 → Luna / 中等 → A/B 升级 / 高 → Terra/Sol 人工平均上下文 200K 证明成本稳定平均掩盖 P99 跨线 跨线前最后工具调用检查 P99 跨线前最后工具调用用 P50/P90/P95/P99 跨线比例 跨线前最后工具调用替换平均把升级率当成优化信号升级率高可能说明路由条件太严或任务分类错升级率与成功率 / cost_per_success 联动升级率必须作为必记录指标与首次成功率 / 严重错误数联动工具循环失控Harness 没设截止条件Harness 仍相信模型更努力就好检查工具循环次数 / 无结果搜索Harness 必须设最大循环次数 / 无结果搜索上限 / 失败回退任务量小时仍维护多模型路由路由工程成本 节省金额任务量 / 路由代码维护成本任务量小时继续用单一强模型路由是规模收益Luna 任务把平均成本打下来平均价被短上下文低费率主导拆分 272K 上下的成本分布报告必须按 272K 阶跃分段展示不能合并人工复核被自动验证器替代自动验证器不能处理高风险决策任务分级高风险决策保留人工责任自动验证器只替代可验证部分Luna 自动成功被当总成功Luna 不通过的尾部仍由升级模型兜底检查升级强模型比例报告必须区分 Luna 首轮成功 / 升级后成功 / 最终失败的拆分把 1.05M 上下文当默认能力272K 阶跃缓存写 / 缓存读 / 工具固定费都独立计费检查跨线比例与缓存命中分布272K 是费率阶跃超过即按长上下文费率1.05M 不是随便用把新价推广到任意上下文区间272K 长上下文费率高于短上下文检查 272K 跨线比例Standard 长上下文输入 0.40 / 缓存读 0.04 / 缓存写 0.50 / 输出 1.80“Luna 输入 0.20 整个请求 0.20”四项费率独立输出 / 缓存写 / 工具不在输入里拆分四项 Token报告必须按 I / R / W / O 四项分别展示作者武子康的个人博客

相关新闻

最新新闻

如何在5分钟内构建本地AI推理引擎:llama-cpp-python深度解析

如何在5分钟内构建本地AI推理引擎:llama-cpp-python深度解析

如何在5分钟内构建本地AI推理引擎:llama-cpp-python深度解析 【免费下载链接】llama-cpp-python Python bindings for llama.cpp 项目地址: https://gitcode.com/gh_mirrors/ll/llama-cpp-python llama-cpp-python是当前最热门的本地AI部署解决方案&#xff…

2026/8/2 3:41:11
Java与Python字符串处理实战:编码、清洗与安全过滤

Java与Python字符串处理实战:编码、清洗与安全过滤

在实际开发中,我们经常会遇到一些看似无意义或包含特殊字符的字符串,例如从用户输入、日志文件、网络爬虫或遗留系统中获取到的“?hyw我的眼睛…”。这类字符串的处理,特别是涉及编码、清洗、分析和存储时,如果处理不当…

2026/8/2 3:41:11
工业视觉小目标检测:从零构建笔尖笔帽数据集实战指南

工业视觉小目标检测:从零构建笔尖笔帽数据集实战指南

1. 项目概述:从零构建笔尖笔帽检测数据集做视觉检测项目,第一步也是最关键的一步,永远是数据。没有高质量、标注精准的数据集,再先进的模型也是“巧妇难为无米之炊”。今天要聊的,就是一个非常具体且实用的工业场景——…

2026/8/2 3:41:11
uni-app微信小程序实现车辆图片滑动查看功能详解

uni-app微信小程序实现车辆图片滑动查看功能详解

1. 项目背景与核心需求在uni-app开发的微信小程序中实现车辆图片滑动查看功能,是当前汽车展示类小程序的标配交互方式。不同于传统点击按钮切换图片的方式,手指滑动操作更符合移动端用户自然交互习惯,能显著提升浏览体验。这个功能看似简单&a…

2026/8/2 3:41:11
基于机器学习模型的缺失值填补:从MICE原理到scikit-learn实战

基于机器学习模型的缺失值填补:从MICE原理到scikit-learn实战

1. 项目概述:当模型成为数据“修复师”在数据清洗的漫长征途中,缺失值处理始终是一个绕不开的核心议题。我们之前讨论过删除、均值/中位数/众数填补、前后向填充等常规方法,它们简单直接,适用于缺失率低、模式随机的场景。但当缺失…

2026/8/2 3:41:11
100、LLC谐振变换器的小信号建模

100、LLC谐振变换器的小信号建模

100、LLC谐振变换器的小信号建模 从一次炸管事故说起 去年夏天,我调试一款300W的LLC电源,满载输出48V/6.25A。开环跑没问题,闭环一上,轻载到半载切换时,MOS管直接炸了。示波器抓到的波形显示:开关频率在负载跳变瞬间出现了约15kHz的振荡,幅度大到让谐振腔电流峰值飙到…

2026/8/2 3:36:11