找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4565

积分

0

好友

597

主题
发表于 1 小时前 | 查看: 5| 回复: 0

AI Agent 的下一步是什么?斯坦福的答案是:让 AI 学会自己改进自己。

这门课是 CS329A《Self-Improving AI Agents(自改进 AI 智能体)》,于 2025 年秋季学期开设。课程不再只讨论如何把 AI Agent 做出来,而是追问一个更难的问题:模型训完以后,能不能通过搜索、验证和环境反馈,继续变强?

现在,课程主页、论文阅读清单和官方录像都已经在线公开。

斯坦福CS329A自改进AI智能体课程官方视频列表

课程主页:https://cs329a.stanford.edu/
官方视频列表:https://www.youtube.com/playlist?list=PLangBM27OtEA

课程由 Aakanksha Chowdhery 和 Azalia Mirhoseini 共同讲授。

Aakanksha Chowdhery与Azalia Mirhoseini两位讲师头像

Aakanksha Chowdhery 是斯坦福大学兼职教授。在谷歌期间,她曾任 540B 参数 PaLM 模型的技术负责人,并参与 Gemini、PaLM-E、Med-PaLM 和 Pathways 等项目。她的研究横跨大模型训练、扩展律与分布式系统。

Azalia Mirhoseini 是斯坦福大学计算机科学助理教授,负责 Scaling Intelligence Lab。她曾在 Google Brain、Google DeepMind 和 Anthropic 工作,参与过 Gemini 和 Claude 的开发。

课程还邀请了多位学界和产业界讲者,主题落在 LLM 推理、编码 Agent、数学证明、自主系统和机器人等方向。公开课表中包括 Google DeepMind 的 Melvin Johnson、Denny Zhou 和 Thang Luong,Reflection AI 的 Misha Laskin,以及 Physical Intelligence 的 Danny Driess 等一众行业大佬。

从大模型讲起,首个教「自改进 Agent」的课

过去几年,大模型的进步主要靠更多数据、更大参数和更多训练算力。CS329A 关心的是另一个问题:模型训练完成后,能不能通过搜索、验证、工具调用、环境反馈和强化学习,在任务中继续变强?

CS329A Self-Improving AI Agents课程标题

这里的「自改进」不是让 Agent 随意改自己的代码。CS329A 课程更关心一个可操作的闭环:模型先生成多个候选答案,用验证器或环境反馈找出更好的结果,再把这些结果变成新的训练信号。它既可以发生在推理时,也可以发生在训练时。

课程从 LLM 自改进方法讲起,包括 Constitutional AI、验证器、测试时算力扩展、搜索与 LLM 的结合,以及通过强化学习扩展训练。后半程转向工具、代码、记忆、多模态交互、多步规划和 Agent 评估。

课程内容

CS329A 持续约 10 周,课程表共有 20 次课。

前半程从测试时算力扩展开始。模型一次生成的答案不够好,那就多采样几次,再用验证器筛选。数学题可以检查答案,代码可以运行测试,开放式任务却很少有现成标准。所以,课程会专门讲结果验证、过程验证和弱验证器。

接下来,Agent 开始调用搜索、运行代码、读取环境状态,并利用执行结果修正下一步。课程会讲到 ReAct、树搜索、多步规划和基于代码反馈的强化学习。

后半程进入训练时扩展。模型在搜索和验证过程中产生的高质量轨迹,可以被用来继续训练模型。这部分会读 STaR、DeepSeekMath 和 DAPO,也会讨论 AI Scientist、AlphaEvolve 与深度研究 Agent。

最后,课程把这套方法放到更长、更真实的任务中:编码 Agent 如何在代码库里工作,长时间任务如何管理记忆,怎样评估数小时甚至数天的 Agent 任务,以及这些方法如何用到多模态机器人上。

课程地址

课程主页: https://cs329a.stanford.edu/

从阅读材料、作业目标和研究项目来看,CS329A 并不是一门面向零基础读者的 Agent 产品课。至少需要熟悉 Python 和 PyTorch,理解 Transformer、监督微调和基本的强化学习概念,并且能够阅读机器学习论文。如果还想完整复现课中方法,最好再补一些搜索、规划、分布式训练和模型评估的知识。

「自改进」这个词很大,CS329A 做的却是很具体的拆解。所以它适合当成 Agent 进阶课程。

这类课程适合边看边实践,遇到问题也可以到 云栈社区 交流讨论。




上一篇:谷歌支付2.6亿英镑和解Google Play开发者集体诉讼
下一篇:Anthropic AI Native SDLC 开发流程实践:从需求到上线的六阶段闭环
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-31 08:01 , Processed in 0.859555 second(s), 39 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表