好家伙,Karpathy 那套“人睡觉,Agent 继续做实验”的玩法,被人搬进日常开发了。
这个开源项目也叫 Autoresearch。给它目标、量化指标,再圈好允许修改的文件,它就循环干活:改代码,跑测试或 benchmark,变好就留,变差直接 git revert,记完日志继续下一轮。Karpathy 原版盯模型训练;这个版本接到了 Claude Code、OpenCode 和 Codex。
项目现在有 14 个命令。debug 找 Bug,fix 清错误,security 做审计,ship 管发版,另外还有回归检查、边界场景和结果分析。普通 /autoresearch 默认跑 25 轮,也能自己改次数。
看到这个能通宵干活的 Agent,我先关心的是搞砸了怎么办。它每次验证前先 commit,坏结果自动回滚;还放了 9 个安全 hook,拦 .env、SSH key、rm -rf、force push 这些高危操作。这个细节比“一晚上跑多少轮”更重要,不然早上看的可能不是结果,是事故。
指标也别写虚了。“覆盖率从 62% 到 70%”“bundle 小 10%”“lint error 清零”,都比“把代码变好”靠谱。
建议先拿边角模块跑 10 到 25 轮,第二天翻 TSV 日志和 git diff,看它是真优化,还是在钻评分规则的空子。支付链路、数据库迁移,先别往里塞。
安装:
npx skills add uditgoenka/autoresearch
Github 地址:uditgoenka/autoresearch
对这类自动化工具有兴趣?云栈社区常有类似讨论,欢迎来交流。
|