找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4376

积分

0

好友

570

主题
发表于 半小时前 | 查看: 3| 回复: 0

好家伙,Karpathy 那套“人睡觉,Agent 继续做实验”的玩法,被人搬进日常开发了。

这个开源项目也叫 Autoresearch。给它目标、量化指标,再圈好允许修改的文件,它就循环干活:改代码,跑测试或 benchmark,变好就留,变差直接 git revert,记完日志继续下一轮。Karpathy 原版盯模型训练;这个版本接到了 Claude Code、OpenCode 和 Codex。

项目现在有 14 个命令。debug 找 Bug,fix 清错误,security 做审计,ship 管发版,另外还有回归检查、边界场景和结果分析。普通 /autoresearch 默认跑 25 轮,也能自己改次数。

看到这个能通宵干活的 Agent,我先关心的是搞砸了怎么办。它每次验证前先 commit,坏结果自动回滚;还放了 9 个安全 hook,拦 .env、SSH key、rm -rf、force push 这些高危操作。这个细节比“一晚上跑多少轮”更重要,不然早上看的可能不是结果,是事故。

指标也别写虚了。“覆盖率从 62% 到 70%”“bundle 小 10%”“lint error 清零”,都比“把代码变好”靠谱。

建议先拿边角模块跑 10 到 25 轮,第二天翻 TSV 日志和 git diff,看它是真优化,还是在钻评分规则的空子。支付链路、数据库迁移,先别往里塞。

安装:

npx skills add uditgoenka/autoresearch

Github 地址:uditgoenka/autoresearch

对这类自动化工具有兴趣?云栈社区常有类似讨论,欢迎来交流。




上一篇:面试了一个某为员工,连归并排序都写不出来,LeetCode中等题直接拜拜?
下一篇:面试官:Redis热点Key如何发现?解决方案有哪些?
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-12 21:03 , Processed in 0.954554 second(s), 39 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表