Uber 把七成代码 PR 交给 AI,AI 账单却零增长是怎么做到的 8 月 27 日Uber 官方博客发了一篇长文讲他们怎么控制 AI 编程成本。据报道Uber 目前超过 70% 的代码 PR 已经由本地或云端 AI Agent 产生工程师团队攒了 3600 多个 Agent 技能每天执行超 3 万次。更夸张的是数据曲线2026 年 2 月到 8 月公司里 AI Agent 的周活跃用户涨了 7 倍周请求量涨了 9.4 倍但总 AI 支出从 4 月开始就基本稳住了。换算到固定模型口径每 1000 次请求的成本比峰值降了约 34%单次会话成本比 6 月峰值降了 52%。用量涨近 10 倍、账单不动这才是这篇文章真正值得看的地方。技术本质AI 编程的账本被拆开了大多数人用 AI 编程只看写没写出来。Uber 的思路是把成本拆成一个乘式总成本 ≈ 采用人数 × 人均请求数 × 每请求 token 数 × 每 token 单价 × 轮次数。前两项是增长项他们不想压真正动手的是后三项——让每个请求更省、每个 token 更便宜、每次对话少绕弯。几个具体的工程手段都是能直接抄作业的模型路由不为所有任务都用最强模型。给每个 Agent 建一个基于真实工作的 benchmark跑分之后选性价比最优他们叫 Pareto 最优的模型子任务默认丢给便宜模型主模型只做拆解和把关。控制上下文即使是 1M 上下文窗口的模型Uber 也默认 400K token 触发自动压缩推理强度默认 Medium。理由很实在上下文越长缓存越容易失效重复计费越多。Prompt 缓存调优他们发现工程师经常把会话晾着超过 5 分钟导致默认 5 分钟的缓存 TTL 频繁失效、每次都要全价重建前缀于是把交互会话的缓存 TTL 改成 1 小时子 Agent 保持 5 分钟。给上下文减负MCP 工具一次性把上百个工具 schema 塞进上下文一个会话开场就背 5 万到 7 万 token 的包袱。Uber 的做法是把 MCP 工具全部 CLI 化、按需加载要哪个工具再现场解析。Code-mode 批量执行让模型用脚本批量做事而不是一轮轮提问—等待—回复。他们实测同一批 SQL 查询走脚本路径比走工具调用路径省 55%~71% 的 token宽表查询省得更多。上下文图谱用 2400 万个节点、8000 万条边的知识图谱给 Agent 指路让它在回答前先定位到正确的表、正确的服务而不是瞎翻代码。文中举例有图谱的 Agent 38 秒答完问题没图谱的翻代码翻了 20 分钟还答错了。说白了Uber 做的不是用 Agent 写代码而是把代码生产重新设计了一遍写代码只是其中一环模型选型、上下文管理、缓存策略、工具接入方式全部变成可优化的工程对象。对普通开发者的意义这事对打工人来说信号挺直接。第一AI 编程的下一个话题不是能不能写而是烧不烧得起。Uber 这种体量都要专门发文讲怎么省 token说明 AI 账单已经成了正经的工程预算。公司迟早会在 Agent 使用上加预算、加监控这不是科幻是已经在发生的事。第二会省 token 正在变成一种新技能。同样的活有人一把梭把整个项目塞进对话、让最贵的模型跑最简单的需求有人拆任务、选模型、控制上下文——后者的账单可能是前者的零头。别小看这个差距绩效季看的就是这个。第三Agent 写代码不代表人没事干。Uber 的数据里70% 的 PR 来自 Agent但 review、返工、CI 修复、兜底还是人来做。未来普通开发者的工作重心大概率会从写往审、拆、管移动。怎么用在自己的项目里个人用 AI 编程不用搞那么大的工程体系但几个原则可以直接套简单任务用便宜模型。改个文案、写个正则别让最强模型出场只有复杂重构、跨文件排查才上旗舰。控制喂进去的上下文。别把整个仓库、整段日志无脑贴进对话先检索再贴或者明确告诉模型只关注这几段。利用缓存和批处理。长会话别频繁中断重启能用脚本循环批量改的别一轮轮让模型来。自己建一个成本敏感的习惯。给常用场景记一下大概 token 消耗做到心里有数。一个朴素但真实的成本估算脚本可以帮你感受每轮重发上下文有多烧钱defestimate_cost(context_tokens,new_tokens,turns,price_in,price_out):简化估算每轮都重发全部历史上下文时的总成本元。total_incontext_tokensnew_tokens# 第一轮for_inrange(turns-1):total_incontext_tokensnew_tokens# 之后每轮重发全部历史costtotal_in*price_in/1_000_000new_tokens*turns*price_out/1_000_000returncost# 单价示意输入 10 元/百万 token输出 30 元/百万 tokenprint(estimate_cost(50_000,2_000,10,10,30))# 10 轮对话print(estimate_cost(50_000,2_000,30,10,30))# 30 轮对话账单接近 3 倍跑一下就能看出来上下文越长、轮次越多输入 token 的复利越吓人——Uber 那些省 token的招本质都是在砍这个复利。顺便说一句Uber 这篇文章的完整方法论里还提到他们不靠降级工具、不靠限制用量而是把没价值的 token 消耗抹掉。这个思路放到个人身上同样成立AI 工具不是越贵越好是花出去的每个 token 都要有产出。你觉得公司层面管 AI 账单是会放开用还是卡预算评论区聊聊。

相关新闻

最新新闻

视频世界模型如何成为零样本物理模拟器?跨本体机器人学习解读

视频世界模型如何成为零样本物理模拟器?跨本体机器人学习解读

最近在梳理具身智能和机器人学习相关的论文时,被标题为 “CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators” 的工作吸引到了。它属于“视频世界模型 物理模拟”这个非常前沿的方向,而且把 Cross-Embodiment&#xff…

2026/8/31 11:09:59
基于大模型API与本地部署的智能作者服务搭建方案

基于大模型API与本地部署的智能作者服务搭建方案

最近一封关于“智能作者”的公开信在开发者社区里被反复转发,其中一位谷歌专家对AI写作工具的判断比较直接:这类系统正在从“玩具”变成内容生产的底座。评论区点赞很高,但多数讨论停留在观点层面,真正关心怎么落地的人并不多。这…

2026/8/31 11:09:59
AI编程效率差距大?上下文、架构、反馈三招打造生产级代码

AI编程效率差距大?上下文、架构、反馈三招打造生产级代码

最近在做项目复盘时发现一个很有意思的现象:团队里所有人都在用 AI 编程工具,但交付效率的差距却越来越大。有人把 AI 当“高级搜索引擎”,问一句、抄一段、能跑就行;有人却能在数小时内完成过去需要数周的开发工作。区别不在工具…

2026/8/31 11:09:59
从零构建量化因子库:数据流设计与工程实践

从零构建量化因子库:数据流设计与工程实践

先问一个问题:你的量化项目里,因子代码是不是经常散落在各种 Notebook、脚本和临时目录里?今天加一个均线偏离度,明天补一个波动率因子,等到回测的时候想找某个因子的完整定义,却发现连当初的参数都记不清了…

2026/8/31 11:09:59
AI替代任务时代,技术人如何用RAG与Prompt工程重构工作流

AI替代任务时代,技术人如何用RAG与Prompt工程重构工作流

比尔盖茨在多个公开场合提醒,AI 可能引发大规模就业冲击。这个判断对技术人来说,不是一条普通新闻,而是一次职业发展路径的重新校准。过去几年,大模型从对话机器人延伸到编程、设计、客服、数据分析等具体岗位任务,自动…

2026/8/31 11:09:59
人形机器人下一程:稳定比炫技更关键,工程化落地才是分水岭

人形机器人下一程:稳定比炫技更关键,工程化落地才是分水岭

一场人形机器人比赛刚刚结束,夺冠的那台机器人没有想象中那种凌厉的机械感,动作甚至有点“羞答答”——步子迈得不大,关节转动也偏慢,像是一个不太自信的孩子在完成一套动作。但就是这台看起来不够酷的机器人,最终稳稳…

2026/8/31 11:04:58