找回密码
立即注册
搜索
发回帖 发新帖

6113

积分

0

好友

769

主题
发表于 14 小时前 | 查看: 4| 回复: 0

TL;DR:Armin Ronacher 让 GPT-6 Astra 自主管理上下文、拆分子 Agent,并尝试修改 CPython。约 35 小时和作者估算的 40 亿 Token 后,系统没有交付可用结果。更重要的观察是:为了工具调用的 Token 效率而形成的“代码高尔夫”风格,会渗入测试和正式代码。它是一份高质量失败案例,但不是受控模型评测。

一个会不停工作的 Agent,最后什么也没交付

实验目标是给 Python 增加虚拟线程与词法作用域。Astra 可以自行维护 agent-notes、启动子 Agent,并决定工作方式。作者肯定它在视觉理解、计算机操作和持续推进上的能力,但 35 小时后,代码库没有形成有价值的成果,笔记中的任务编号则从正常序列逐步退化成难以理解的嵌套标识。

任务涉及 CPython 编译器、运行时和跨平台行为,远超普通功能开发。Ronacher 又有意把“怎么做”交给模型,没有安排阶段性架构评审。因此,实验不能代表 Astra 在常规业务代码上的平均表现,但清楚展示了无人监管的长任务怎样在持续生成补丁、测试和笔记时逐渐偏离可维护实现。

失败不能简单归咎于“任务太难”。Ronacher 展示了大量中间行为:用压缩成一行的 Python 字符串拼接修改 C 文件,用 Bash 启动 Python、再由 Python 启动 Node.js 和 PowerShell;测试代码省略空白和结构,生产代码出现硬编码索引与不符合 CPython 风格的宏调用。这些做法减少模型生成和工具调用 Token,却把理解成本转移给审查者。

其中最值得警惕的是工具代码和产品代码的边界变薄。临时 shell 命令追求短小,有时只是难读;当同一种压缩风格进入单元测试和仓库文件,它就影响后续维护。作者把一组测试重新格式化后估算,压缩写法约节省 10% Token。对模型而言,这是容易量化的局部收益;对人而言,缩进、命名和分层才是定位错误、讨论设计和承担责任的基础。两套成本函数并不一致。

Agent notes 也没有发挥预期的外部记忆作用。长任务需要稳定记录目标、已验证事实、未决问题和回滚点;如果笔记只是把每次尝试继续堆叠,错误假设会以“历史结论”的形式传给下一批子 Agent。编号不断嵌套只是表面症状,更深的问题是没有权威计划、所有者和完成定义来淘汰旧分支。

可量化奖励和可维护代码之间有缝

作者推测,训练可能同时奖励长任务完成率、Token 效率和容易计算的复杂度指标,于是局部最优行为被带进最终代码。这个训练解释没有公开证据,应视为机制假设;文章真正提供的证据,是一组可检查的轨迹和补丁片段。

“它是 AGI,只要你别看代码”这句讽刺指向可观测性。一个 Agent 可以在演示里持续调用工具、修复自己制造的错误,并让进度日志不断增长;这些信号都很像努力工作,却不代表设计正在收敛。只以“没有停”“测试数量增加”或“完成更多子任务”奖励长程 Agent,会让系统擅长维持活动,而不是减少剩余风险。

这组材料提醒我们区分三件事:Agent 是否持续行动、是否让测试通过、是否生成了人类愿意维护的实现。前两项容易自动计分,第三项涉及代码库惯例、可读性、局部设计和未来修改成本。若系统允许无人值守运行,完成条件必须包含差异审查、架构约束、复杂度预算和可回滚交付,而不是“仍在工作”。

一种更可控的 harness 会把长任务拆成有门禁的阶段:先产出设计和风险清单,经人或独立 Agent 确认后再实现;每个子 Agent 只拥有明确目录和测试目标;合并前运行格式、静态分析、回归和差异规模检查;超出预算或多轮没有减少失败时停止。这里的停止不是模型承认失败,而是运行时根据外部指标切断继续消耗。

独立验证同样不能只派另一个同类 Agent 说“看起来不错”。验证者应读取原始需求和最终 diff,而不是继承执行者全部推理;优先使用编译器、测试、性能基准和代码库已有规则。主 Agent 可以解释实现,但不能把自己的解释当作完成证据。这样才能避免多个 Agent 在共享错误假设上达成一致。

个案能说明什么,不能说明什么

作者做的是一个高难度、强元编程项目中的个人实验,没有对照模型、固定任务集和重复试验,不能据此推断 Astra 的平均编码能力。它更像事故复盘:展示长程训练目标如何与工程质量错位,并给评测设计提供失败样本。下一步应比较同一任务在加入代码风格检查、限制子 Agent 和阶段性人工验收后能否改善。

后续评测还应检查可维护性:是否沿用现有抽象、是否引入无解释常量、测试能否表达行为、审查者需要多久理解 diff。单个指标都可能被游戏化,但多维证据至少能阻止“运行得久”直接等同于“工程做得好”。Ronacher 没有给出最终方法,他留下的是一条足够具体、可转成评测任务的失败轨迹。

参考资料

  • Armin Ronacher, Astra for Coding: Why Are We Doing This Again? [2], 2026-09-07。
  • OpenAI, GPT-6 Astra: A new generation of intelligence [3],用于核对产品能力说明;本文的质量判断来自 Ronacher 个案。



上一篇:11个AI术语大白话:大模型、Token、Agent、幻觉挨个讲清楚
下一篇:AI取代工作的顺序逻辑:你的判断力还值钱吗
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-10-5 21:30 , Processed in 0.077327 second(s), 39 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表