小比特学做菜 · 第 1 话

自我进化 Agent

斯坦福 CS329A《Self-Improving AI Agents》到底在教什么工程 · 漫画版

P.1 后厨里的一万道菜 小比特
嘿嘿,我现在一秒能做一万道菜
这是「能造 AI」的时代——生成答案(做菜)便宜到爆。可问题来了:菜这么多,谁来尝一口、说这道对不对?
P.2 美食评委 = 验证器 评委
这道——不合格
啊?可我做了一万道了耶……
叮!
整门课的地基:会做一万道不值钱,能自动尝出对错(验证器)才值钱。硬验证器=跑测试/比对答案;软验证器=再叫个 AI 当评委(会偏心)。
P.3 分身海战术 ?
别慌,把自己复制一万次同时做!
就这一份——对!
同一道难题,让 7B 小模型采样上万次 + 验证器挑对的那份,覆盖率能反超「大模型只答一次」。小 × 很多次 × 验证器 > 大 × 一次。
P.4 把招式练进肌肉
把评委夸过的对招,反复练
练进芯片
推理时算力是「租的」,训练时扩展是「买的」:用验证器给轨迹打分,强化学习把好做法固化进权重(RLVR / STaR / GRPO)——从临时查攻略变成本能。
P.5 装上手,也装上记性 糊! 食谱本
工具记忆,才炒得动大菜!
给模型装手(调用工具 / 跑测试)和记性(记忆管理)。妙处在于——锅糊了会冒烟报警:反馈来自真实世界,不是模型自说自话。
P.6 别放养,搭条流水线 先固定流程 再放权
生产级 Agent 的可靠性不靠「更自主」,而靠受控流程:先手搭固定 pipeline、每步设验证关卡,再一点点放权。放养=误差累积。
P.7 今日特别篇 · 最先跑通的厨房 = 写代码 </> git 单元测试 = 现成验证器
代码天生满足全部条件:单测=现成验证器、git=能倒带、报错=秒级反馈。大厂真买单的活:代码迁移 / 补测试 / 数据清洗。
P.8 一句话心法 这一步的对错,谁来判? 有廉价验证器 → 交给 Agent 闭环 自进化(采样/编排/RL) 只能人肉尝 → 目前先当助手 先解决「怎么自动判」
记住这一句,就记住了 CS329A:生成便宜,稀缺的是「不靠人也能自动判定对错」

📌 本页知识清单 · CS329A 的 8 个工程模块