找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

6027

积分

0

好友

771

主题
发表于 前天 21:31 | 查看: 0| 回复: 0

OpenAI公开了一份内部数据,回答一个此前只存在于猜测中的问题:AI Agent到底在多大程度上加速了 AI 自己的科研。

博客里最值钱的不是那些亮眼的数字,而是它第一次公开了「怎么测」——尤其是其中最核心的一章:研究员交给 agent 的活正在怎么变。

更有说服力的佐证是,OpenAI 刚刚宣布用 10000 个 Agent、88 小时解决了一道千禧年数学问题:纳维-斯托克斯(Navier-Stokes)方程,业内热议的 165 页论文也已公开(文末附链接)。

OpenAI官方推文:用下一代模型Agent解决纳维-斯托克斯千禧年难题

目标先行,测量跟上

先交代背景:「AI 研究实习生」已于 2026 年 9 月如期到岗——定义为能在人类指导下完成明确研究任务的系统,包括需要熟练研究员花几天才能做完的任务;下一步是 2028 年 3 月造出「自动化 AI 研究员」。

OpenAI RSI时间线:AI研究实习生到自动化AI研究员

有了目标,就要回答「离目标还有多远」。OpenAI 的做法是分三层测量:先看用量(agent 用得有多凶),再看任务(agent 干的是什么活——这是全文的核心),最后看结果(办成多少事)。

用量层:agent 用得有多凶

这一层最好测,数字也最抓眼:中位数研究员每天消耗超过 $600 的 token(按 API 价格折算),前 10% 的用户每天超过 $7,000;每投入 1 个人类工作日,研究组织总量上就有 3.1 个 agent 工作日在跑——而今年 6 月之前,这个比值还小于 1。

中位数研究人员内部编码代理使用率趋势

前90%研究人员内部编码代理使用率趋势

但 OpenAI 自己也承认,用量数字「易测难解」:token 烧得多,不代表研究真的变快。真正有解释力的是下一层。

OpenAI研究员与Agent工作量对比数据图

任务层:研究员交给 agent 的活,正在变

这是整篇博客方法含量最高的一章,也是理解「科研加速」的关键:加速不是均匀发生的,它有明确的结构和方向

OpenAI 没有数 token 了事,而是借用了 Epoch AI 为前沿 AI 研发专门改造的分类法(灵感来自职业分类系统 O*NET),把 agent 消耗的 token 按研发流程的六个阶段归类:

OpenAI编码代理六阶段研究流程图

  • Decide:决定做什么、放弃什么、算力给谁
  • Design:研究想法和工程方案
  • Build:代码和数据集
  • Run:训练与评测、硬件、部署
  • Analyze:分析实验、模型、部署结果
  • Communicate:汇报结论、反馈、状态与决策

六类研究活动输出token增长条形图

分类之后,变化的方向一目了然。1 月到 8 月,六个类别的用量全部上涨——agent 已经渗进研发流程的每一段,不再只是「写代码工具」。但涨幅并不平均:1 月时的大头是研究基础设施代码,8 月时这类继续扩张,技术支持类和运行监控类明显上涨。而站在金字塔尖的高层规划,占比依然极小——agent 接的活越长越难,但「决定研究方向」这件事还牢牢在人手里。

人工支持故障排除帖子数量趋势

结构性变化最有说服力的旁证,藏在两个日常细节里。其一,agent 最强的拿手活是排查内部研究基础设施的故障——这本来就是科研的一个实打实的瓶颈;

Agent零干预任务成功率随任务时长变化

多家团队为研究员答疑的 office hours 在 2026 年出勤率持续下滑,其中一家干脆停办,腾人手去改系统。其二,主要内部技术支持频道的每日发帖量下降,而且据 OpenAI 所知,这些提问并没有转向其他人工支持的渠道——需求不是被搬走了,是被 agent 消化掉了。

不同任务时长下结果的干预情况堆叠图

结果层:办成多少事

任务结构变了,还得验证结果。OpenAI 用自家的 agentic 分类器,给能找到真实结果的任务打分(难度按「一个人类大概要花多久」分桶):1 月到 7 月,各难度档位的成功率普遍上升——包括那些人要干几个小时的活。

另一面同样重要:过去 6 个月里,成功的 4–8 小时长任务中,超过一半需要至少 1 次人工干预。agent 能接长活了,但复杂任务仍然离不开人在旁边扶一把。

层次 指标 读数
用量 中位数研究员日耗 token 超过 $600
用量 agent 工作日 ÷ 人类工作日 3.1
任务 六类研发活动的 agent 用量 全部上涨
任务 高层规划占 agent 输出 极小
结果 成功的 4–8 小时任务需人工干预 超过一半

公开本身,就是方法论

通读全篇,这份公开的完整逻辑是:先立带日期的目标(实习生已达成,研究员定档 2028 年 3 月),再公开三层测法——用量、任务、结果,数字和事故一起报,连方法的局限一并承认。OpenAI 还承诺,发现无法保障的安全风险时会减速甚至停止,并呼吁全行业把 RSI 进展的公开追踪变成标配。

OpenAI研究方法附录文档截图

Research acceleration: The view inside OpenAI
https://openai.com/index/research-acceleration-view-inside-openai/
https://openai.com/index/navier-stokes-solution/
https://cdn.openai.com/pdf/32d9f210-8b73-45e0-91bc-82a30aef8a9a/navier-stokes.pdf

如果你也在持续跟进 AI 科研自动化的进展,欢迎来云栈社区一起交流。




上一篇:微信零点击蠕虫WeWorm跨安卓iOS扩散,无需接听即可盗号(已修复)
下一篇:Redis 全文搜索实战:RediSearch 部署、索引操作与 Java 集成教程
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-13 17:51 , Processed in 1.737382 second(s), 45 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表