9月6日,OpenAI发布内部研究报告,首次用量化数据披露Agent在其研发体系中的真实参与度。这不只是AI行业的事——它正在重新定义"知识工作"的成本结构,也在改写B2B获客的底层逻辑。
3.1:1——一个需要认真对待的比例
先看数字。截至2026年8月中旬,OpenAI研究部门每投入1个人类工作日,就有3.1个Agent工作日在同步运转。中位数研究员每天消耗的推理资源,按API价格折算超过600美元;用得最猛的前10%,日消耗突破7000美元。
注意,这不是说效率翻了3倍。3.1倍说的是"运转时长"——一个研究员不再是一件件事排队做完,而是同时开着好几个Agent各干各的。一个改实验代码,一个查基础设施问题,一个盯训练监控,还有一个在跑结果分析。研究员自己在这几个Agent之间来回切,根据返回做判断、定方向。
这种工作方式半年前还不存在。2026年初Agent用量很小,到6月Agent总时长才第一次超过人类,8月就拉开到了3.1倍。增速本身,比绝对值更值得注意。
哪些活被接走了,哪些还没有
OpenAI借用了Epoch AI的分类框架,把AI研发拆成六个环节:Decide(决定做什么)、Design(设计方案)、Build(写代码、建数据)、Run(训练、评测)、Analyze(分析结果)、Communicate(对外输出)。
1月到8月,Agent在六个环节的使用量全部在涨。但分布很不均匀——增长最猛的是基础设施代码、实验监控和技术支持。几个原本定期给研究员办技术答疑的团队,发现来问问题的人越来越少,有一个干脆取消了答疑时段。Agent先把问题解决了,人类不用出马了。
但高层规划呢?基本没动。Decide环节Agent输出的token占比一直很低。研究方向的判断、结果的价值评估、要不要扩大训练、要不要上线部署——这些全在人手里。
更具体的数据:4到8小时的复杂任务,过去半年成功率确实在涨,但超过一半的成功案例仍然需要至少一次人工干预。Agent在变强,但"强"和"自主"之间还隔着相当一段距离。
一个被忽略的问题:新人怎么长出来
报告里有个现象容易被乐观情绪盖过去:当执行层面的工作越来越多地被Agent接手,那些原本需要亲手做这些工作才能积累经验的年轻人,怎么办?
今天能判断"什么值得做"的资深研究员,恰恰是因为年轻时写过大把实验代码、调过无数bug、处理过各种异常结果。这些活不高级,但它们是建立专业直觉的必经之路。如果这些活以后都是Agent干,下一代专家从哪来?
这不是OpenAI需要回答的问题,但每家B2B企业都绕不开。当市场部的内容生产、数据分析、线索跟进开始大面积交给Agent,团队里那些原本靠这些活练手的年轻人,他们的成长路径被抽掉了。效率是上去了,但组织的"判断力储备"可能正在被消耗。
对B2B获客来说,游戏规则正在变
把视线拉回B2B企业。这件事对你的意义,不在于"AI多厉害",而在于它改变了一个基本假设:当执行不再稀缺,什么才是壁垒?
过去十年B2B数字获客的逻辑是"谁做得多谁赢"——谁发文章多、谁投关键词多、谁铺平台多。本质上都是执行力竞争。
Agent时代的逻辑不一样了。当一个人带着几个Agent就能完成原来一个团队的工作量,"做得多"不再是优势。真正拉开差距的是:你决定做什么内容、选什么角度、用哪些案例、怎么让AI搜索引擎认为你值得引用。
换句话说,判断力替代执行力,成为B2B获客的新分水岭。
这也是为什么GEO(生成式引擎优化)变得越来越重要。当越来越多采购决策经由AI助手完成,你的内容能不能被AI理解、引用、推荐,直接决定了你能不能进入那张"AI候选名单"。而这件事的核心不是SEO技巧,是你有没有真正拿得出手的案例、经得起验证的数据、说得出道理的方法论。
市场部要重新想自己的定位
对B2B市场部来说,最直接的冲击是:原来团队60%-70%的时间花在"做"——写文章、跑数据、跟线索、出报告。现在这些活Agent能做相当一部分,人应该做什么?
答案可能不那么舒服:做判断。
决定什么问题值得写,决定哪些案例有说服力,决定品牌在AI认知中要占据什么位置。这些是Agent短期接不了的活。不是因为它不够聪明,而是因为它缺乏对企业真实处境的理解——你的客户到底在纠结什么,你的产品到底解决了什么别人解决不了的问题,你的行业里哪些数据经得起追问。
我们在服务B2B客户时有一个明显感受:那些在AI时代真正拿到结果的企业,不是AI用得最多的,而是对自身定位最清楚的。Agent帮他们放大了原有优势,而不是从零制造优势。
OpenAI给自己设的下一个目标是2028年3月实现"全自动化AI研究员"。从当前数据看,高层决策仍需人类判断,但执行层面的重塑已经发生。对B2B企业来说,核心问题不再是"要不要用AI",而是:当所有人都在用AI做执行的时候,你拿什么赢?
