P.1
后厨里的一万道菜
嘿嘿,我现在一秒能做一万道菜!
这是「能造 AI」的时代——生成答案(做菜)便宜到爆。可问题来了:菜这么多,谁来尝一口、说这道对不对?
P.2
美食评委 = 验证器
这道——不合格!
啊?可我做了一万道了耶……
叮!
整门课的地基:会做一万道不值钱,能自动尝出对错(验证器)才值钱。硬验证器=跑测试/比对答案;软验证器=再叫个 AI 当评委(会偏心)。
P.3
分身海战术
别慌,把自己复制一万次同时做!
就这一份——对!
同一道难题,让 7B 小模型采样上万次 + 验证器挑对的那份,覆盖率能反超「大模型只答一次」。小 × 很多次 × 验证器 > 大 × 一次。
P.4
把招式练进肌肉
把评委夸过的对招,反复练!
练进芯片!
推理时算力是「租的」,训练时扩展是「买的」:用验证器给轨迹打分,强化学习把好做法固化进权重(RLVR / STaR / GRPO)——从临时查攻略变成本能。
P.5
装上手,也装上记性
有工具和记忆,才炒得动大菜!
给模型装手(调用工具 / 跑测试)和记性(记忆管理)。妙处在于——锅糊了会冒烟报警:反馈来自真实世界,不是模型自说自话。
P.6
别放养,搭条流水线
生产级 Agent 的可靠性不靠「更自主」,而靠受控流程:先手搭固定 pipeline、每步设验证关卡,再一点点放权。放养=误差累积。
P.7
今日特别篇 · 最先跑通的厨房 = 写代码
代码天生满足全部条件:单测=现成验证器、git=能倒带、报错=秒级反馈。大厂真买单的活:代码迁移 / 补测试 / 数据清洗。
P.8
一句话心法
记住这一句,就记住了 CS329A:生成便宜,稀缺的是「不靠人也能自动判定对错」。
📌 本页知识清单 · CS329A 的 8 个工程模块
- ① 验证器(地基):硬=测试/比对,软=LLM 当裁判,弱验证器集成投票。
- ② 推理时算力:多采样 + 验证器挑优,小模型也能盖过大模型单次。
- ③ 训练时 RL:RLVR / STaR / GRPO,把验证器筛过的好轨迹固化进权重。
- ④ 工具 / 代码 / 记忆:ReAct 想-做交替、执行反馈、记忆管理。
- ⑤ 规划编排:受控流程 > 放养,每步设关卡,再逐步放权。
- ⑥ 评测:回归测试集 + 自动评分器;前沿=AI Scientist / AlphaEvolve 式自我进化。
- ⑦ 落地首选:软件工程 Agent(单测=验证器、git=可回滚)。
- 精读顺序:第 2→3→6→7→13 讲。检查语:这一步对错谁来判、成本多少?