Agentic AI 时代,为什么强化学习又成了"必修课"?
从训狗到训 AI,从 AlphaGo 到 Agent,强化学习正在从"一种算法"变成"未来智能的底层操作系统"。 一、训狗与训 AI,用的是同一套逻辑 你养过狗吗? 如果你试过教一只狗坐下,你会发现整个过程出奇地简单:狗做对了,你给它一块零食;狗做错了,你不给。重复几十次之后,狗就学会了——"坐下...
从训狗到训 AI,从 AlphaGo 到 Agent,强化学习正在从"一种算法"变成"未来智能的底层操作系统"。
一、训狗与训 AI,用的是同一套逻辑
你养过狗吗?
如果你试过教一只狗坐下,你会发现整个过程出奇地简单:狗做对了,你给它一块零食;狗做错了,你不给。重复几十次之后,狗就学会了——"坐下"这个动作,和"有吃的"这个结果,是绑在一起的。
狗并不理解"坐下"是什么意思。它只是在学习一种关联:什么行为能带来奖励,什么行为不能。
这就是强化学习(Reinforcement Learning,简称 RL)的本质。
不是告诉它标准答案,而是让它在试错中发现规律。做对了给奖励,做错了给惩罚(或者没有奖励),慢慢就学会了最优策略。
AI 的强化学习,逻辑一模一样。
一个 Agent(智能体)在环境里行动,每一步都根据结果获得一个"奖励信号"。奖励高的行为被保留,奖励低的行为被修正。经过成千上万次尝试,Agent 就学会了在这个环境里"怎么活"。
这和监督学习有本质区别。监督学习是"填鸭式教育"——给标准答案,让模型死记硬背。强化学习是"实践出真知"——不给答案,只给反馈,让模型自己在摸爬滚打中成长。
今天的大模型能聊天、能写代码、能画画,但这些能力大多是"知识"层面的。让它自主规划、自主行动、自主纠错——这需要的不只是知识,是行为。而塑造行为,正是强化学习的专长。
所以问题来了:当 AI 从"回答问题"进化到"完成任务",强化学习为什么成了绕不开的必修课?
二、Richard Sutton:在地下室写出 RL 圣经的人
要理解强化学习为什么重要,得先认识一个人。
Richard Sutton,加拿大阿尔伯塔大学教授,公认的"强化学习之父"。
1980 年代,Sutton 在斯坦福大学读博。当时的 AI 主流是符号主义——科学家们相信,智能就是手写规则,把人类的知识一条条编码进计算机。谁写得多、写得细,谁的系统就聪明。
Sutton 的导师 Andrew Barto 给了他一个完全不同的方向:让机器通过试错自己学习。
这个方向在当时几乎没人看好。符号主义如日中天,神经网络还在第一次寒冬里挣扎。让机器"自己摸索"?听起来像天方夜谭。
Sutton 后来在回忆中说,他早期的工作很多时候是在"地下室"里完成的——字面意义上的地下室,也是比喻意义上的边缘地带。没有人相信这件事能成,但他和 Barto 坚持了下来。
1984 年,Sutton 的博士论文提出了 TD Learning(时序差分学习),奠定了现代强化学习的数学基础。1998 年,两人合著的《Reinforcement Learning: An Introduction》出版,这本书至今是 RL 领域的标准教材,被引用超过 5 万次。
Sutton 有一句被广为引用的话:
"The biggest lesson that can be read from 70 years of AI research is that general methods that leverage computation are ultimately the most effective."
(70 年 AI 研究的最大教训是:利用计算的通用方法最终最有效。)
这句话写于 2019 年,但精准预言了今天的局面。
不是人类手把手教每一个步骤,而是设计一个通用的学习框架,让计算自己去发现答案。AlphaGo 是这样,ChatGPT 是这样,今天的 Agentic AI 也是这样。
Sutton 在地下室里写下的东西,正在成为整个 AI 行业的地基。
2024 年,Sutton 与 Andrew Barto 一起获得了图灵奖——计算机科学界的最高荣誉,相当于这个领域的诺贝尔奖。颁奖词明确提到,他们的贡献"为强化学习奠定了概念和算法基础"。
从地下室到图灵奖,这条路走了四十年。Sutton 的获奖,标志着强化学习从边缘学科正式进入了计算机科学的核心殿堂。
三、强化学习的三个核心要素
强化学习的框架出奇地简洁,只有三个核心要素:
Agent(智能体):做决策的实体。可以是一只狗、一个迷宫里的人、一个下棋程序、一个大语言模型。Agent 不挑对象,只负责"在环境里行动"。
Environment(环境):Agent 面对的世界。对狗来说是房间和街道,对 AlphaGo 来说是棋盘,对代码 Agent 来说是代码库和测试环境。
Reward(奖励):环境给 Agent 的反馈。做对了给正分,做错了给负分,什么都不做可能给零分。
三个要素构成一个循环:
Agent 观察环境 → 选择动作 → 环境变化 → 获得奖励 → Agent 学习调整 → 再观察 → 再选择……
这个循环跑上几万次、几百万次,Agent 就从"随机乱动"进化成了"行家里手"。
这里有几个关键概念,值得用生活里的例子理解:
探索 vs 利用:你有一家常去的餐厅,味道稳定。但街角新开了一家,可能更好,也可能更差。去老店是"利用"(已知最优),去新店是"探索"(寻找更优)。好的 Agent 要学会平衡两者——不能太保守(永远去老店),也不能太激进(永远试新店)。
延迟奖励:现在吃苦,将来享福。健身时肌肉酸痛(负奖励),但三个月后身材变好(正奖励)。下棋时牺牲一个子(负奖励),但十步后赢得整盘(大正奖励)。Agent 必须学会"为了长远利益,忍受短期损失"。
策略(Policy):Agent 的"行为手册"。刚开始是随机的,什么都试。慢慢发现哪些行为奖励高,策略就越来越精。最终收敛到一套"在这个环境里,什么状态下该做什么动作"的最优方案。
这套框架的通用性极强。狗、人、机器人、大模型——都可以用同一套逻辑训练。
四、当代 AI 中强化学习的四大战场
战场一:RLHF——让大模型学会"说人话"
GPT-3 刚出来的时候,有一个让人哭笑不得的特点:它什么都能写,但写出来的东西经常"不对劲"。
你让它写一个建议,它可能写得很冒犯。你让它回答一个敏感问题,它可能胡说八道。你让它帮忙写邮件,它可能写得像机器人——因为它本来就是机器人。
问题出在哪?
GPT-3 的训练方式是"预测下一个词"。它看了互联网上几千亿个词,学会了"人类通常怎么接话"。但它不知道什么回答是好的、什么回答是人类喜欢的。它只会"接龙",不会"做人"。
OpenAI 的解法就是 RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)。
这个过程分三步:
第一步,人类标注员给同一个问题的多个回答打分排序。比如问"如何保持健康",回答 A 比回答 B 更好,回答 B 比回答 C 更好。
第二步,用这些排序数据训练一个"奖励模型"(Reward Model)。这个模型学会了模仿人类的偏好——什么样的回答应该得高分,什么样的应该得低分。
第三步,用强化学习(具体是 PPO 近端策略优化算法,Proximal Policy Optimization)优化大模型。模型生成一个回答,奖励模型打分,分数高的方向被强化,分数低的方向被抑制。
2022 年 3 月,OpenAI 发布了 InstructGPT 论文,首次系统展示了 RLHF 的效果。结果令人震惊:1.3B 参数的 InstructGPT(用 RLHF 训练),在人类评估中优于 175B 参数的 GPT-3(纯预训练)。
小模型+RLHF,打败了大模型。
RLHF 让 AI 从"会写字"变成了"会做人"。
战场二:GRPO / DeepSeek-R1——让模型学会"深度思考"
有些问题,不是直觉能答的。
比如一道复杂的数学题,或者一段需要多步推理的代码。你不可能"一眼看出答案",必须一步步推导、验证、纠错。
大模型原本不擅长这个。它的训练目标是"预测下一个词",天然倾向于快速给出直觉性回答。但 2024 年 9 月,OpenAI 发布的 o1 模型改变了这个局面。
o1 的核心创新是推理时计算——模型在给出最终答案之前,会生成很长的内部思维链。它自我质疑、自我验证、自我纠错。就像一个人做数学题时,在草稿纸上写满推导过程,而不是直接写答案。
这个能力是怎么训练出来的?
核心方法还是强化学习。但有一个关键区别:不需要人类标注每一步推理过程。
传统的监督学习,需要人类写出完整的解题步骤,然后让模型模仿。但复杂的推理问题,人类自己写步骤都很困难,更别提标注几百万条了。
DeepSeek 团队的解法叫 GRPO(Group Relative Policy Optimization,群体相对策略优化)。
思路很巧妙:给模型一个问题,让它生成多条不同的推理路径。有的路径最后答对了,有的答错了。答对的路径获得奖励,答错的没有。模型慢慢就学会了"什么样的推理过程更可能导向正确答案"。
2025 年 1 月,DeepSeek 发布 R1 模型,完全开源。训练成本约 600 万美元,却逼近了 OpenAI o1 的水平。全球震动。
DeepSeek 团队在论文中记录了一个有趣现象——训练过程中,模型自发学会了"重新检查自己的答案"。在某一时刻,模型的推理链中突然出现了类似 "Wait, let me verify this..."(等等,让我验证一下)这样的自我修正行为。
这不是人类教的。是 RL 训练涌现出来的。
这个项目的灵魂人物是 梁文锋,DeepSeek 创始人。1985 年生,浙江大学电子信息工程本科+硕士。早年做量化交易,创立了幻方量化,管理规模一度过千亿。2023 年,他创立 DeepSeek,转向通用 AI。R1 发布后,他以极低成本逼近 OpenAI 水平的成绩,让全球重新评估中国 AI 的实力。
GRPO 让 AI 从"快思考"变成了"慢思考"。
战场三:AlphaGo → AlphaZero——强化学习的两次飞跃
很多人分不清 AlphaGo 和 AlphaZero,但它们的区别,恰好说明了强化学习的两个层次。
AlphaGo(2016):站在巨人肩膀上
2016 年 3 月,韩国首尔四季酒店。AlphaGo 与世界围棋冠军李世石进行五番棋对决,全球 2.8 亿人观看直播。
结果:AlphaGo 4:1 获胜。
这场比赛震惊世界。围棋被认为是人类智慧的最后堡垒,19×19 的棋盘上有 10^170 种可能的局面,比宇宙中的原子还多。计算机怎么可能赢?
AlphaGo 的方法是混合路线:
第一步,用 16 万盘人类职业棋谱进行监督学习,让模型学会"人类高手怎么下"。
第二步,再用强化学习自我对弈,进一步提升。
换句话说,AlphaGo 是"先跟人类学,再超越人类"。
这场比赛的灵魂人物是 Demis Hassabis,DeepMind 创始人。1976 年生于伦敦,父亲是希腊裔塞浦路斯人,母亲是新加坡华人。他 4 岁开始下棋,13 岁达到国际象棋大师级,是当时世界排名第二的同龄棋手。后来他在剑桥大学学习计算机科学,在伦敦大学学院拿到神经科学博士学位。
Hassabis 创立 DeepMind 的初衷是"用 AI 理解智能本身"。围棋只是第一步。
比赛中有两个著名插曲,恰好说明了人与 AI 在围棋上的不同。
第一个插曲在第 2 盘。 AlphaGo 下出了第 37 手——一颗落在五路肩冲的棋子。当时在场的职业棋手一片哗然,解说员认为这步棋"业余水平",完全不符合人类围棋的定式。但后续发展证明,这步棋打开了全新的局面,最终帮助 AlphaGo 赢下这一盘。事后复盘,职业棋手们承认这步棋超越了人类千年积累的围棋理论,是一种"来自另一个维度"的下法。
第二个插曲在第 4 盘。 李世石下出了第 78 手——后来被命名为"神之一手"的挖/肩冲。这一步让 AlphaGo 的胜率评估从 70% 骤降到 50% 以下,后续 AlphaGo 接连出错,李世石赢得了五盘比赛中唯一的一局。
两个插曲的对比很有意思:AlphaGo 的创新来自数百万盘自我对弈的统计最优;李世石的"神之一手"来自人类在绝境中的灵光一闪。两种智能,两种创造。
AlphaZero(2017):从零开始,自己教自己
2017 年 10 月,DeepMind 发布 AlphaZero。与 AlphaGo 最大的区别,用一句话就能概括:完全不需要人类棋谱。
AlphaZero 是纯强化学习。从零开始,随机落子,自己跟自己下。赢了加分,输了扣分。通过数百万盘自我对弈,独立发现了人类围棋几千年积累下来的定式、战术和战略。
结果更惊人:AlphaZero 只用 24 小时,就达到了超越 AlphaGo 的水平。
之后,DeepMind 用同样的方法训练它下国际象棋和将棋。同样从零开始,同样 24 小时内达到世界冠军水平。
国际象棋大师在看完 AlphaZero 的棋谱后说:"它下棋的方式不像人类,也不像机器,像是来自另一个维度。"
AlphaZero 甚至下出了人类从未想到过的棋招。比如国际象棋中,它频繁进行"牺牲子力"的布局,这在人类棋谱中很少见,但 AlphaZero 发现这是通往胜利的最优路径。
两者的区别,是 RL 威力的两个层次:
| AlphaGo | AlphaZero | |
|---|---|---|
| 学习方式 | 人类棋谱 + RL 自我对弈 | 纯 RL 自我对弈 |
| 起点 | 站在人类知识上 | 完全从零 |
| 发现能力 | 优化人类已知策略 | 独立发现新策略 |
| 通用性 | 只下围棋 | 围棋、象棋、将棋通用 |
AlphaGo 证明了"RL 能超越人类"。AlphaZero 证明了"RL 能不需要人类就超越人类"。
这是强化学习最震撼的地方:它不只是模仿人类,它能创造人类想不到的东西。
战场四:Agentic RL——让 Agent 学会"做事"
前面三个战场,AI 的"输出"还是信息——一段文字、一个答案、一步棋。
但 Agentic AI 时代,AI 的"输出"是行动。点按钮、调 API、写代码、改文件、浏览网页、操作软件。
这带来一个全新的训练难题:怎么让 Agent 学会"做事"?
OpenAI 的 Computer Use(2024) 是一个标志性尝试。OpenAI 让模型能直接操作电脑界面——看屏幕、移动鼠标、点击按钮、输入文字。训练方法的核心就是强化学习:模型在虚拟环境中尝试各种操作,根据任务完成度获得奖励。
Anthropic 的 Claude Computer Use(2024) 走了类似路线。Claude 能控制用户电脑,完成填写表单、搜索信息、提交报告等任务。
Google DeepMind 的 AlphaDev(2023) 则展示了 RL 在底层算法上的威力。团队让 Agent 在汇编代码层面尝试各种指令组合,根据排序速度和正确性获得奖励。最终,AlphaDev 发现了一种比人类专家写了几十年的算法更快的新排序算法。
这些任务有一个共同特点:没有标准答案。
监督学习需要"输入-输出对"——给问题,给标准答案,让模型模仿。但 Agent 的任务怎么给标准答案?
一个任务可能 100 步,最后成功了,中间哪步对哪步错?这是 RL 的经典难题,叫信用分配问题(Credit Assignment)。
当前的主流解法是:
- 结果反推:最后成功了,整条路径都获得一定奖励。
- 中间检查点:设置阶段性目标,完成一个阶段就给奖励。
- 人类反馈辅助:人类在关键节点给反馈,帮助 Agent 纠正方向。
Agentic RL 让 AI 从"会说话"变成了"会做事"。
五、为什么 Agentic AI 时代,强化学习非火不可?
四个战场看下来,一个趋势很清楚:强化学习正在从"辅助技术"变成"核心基础设施"。
为什么是现在?四个原因:
第一,Agent 的本质是"行动",不是"回答"。
聊天机器人可以靠监督学习训练——给问题,给标准答案,让模型模仿。但 Agent 要在开放环境里做决策,没有标准答案,只有结果好坏。这正是 RL 的领地。
第二,环境越复杂,RL 越不可替代。
下棋(AlphaGo/AlphaZero):规则明确,状态有限,RL 已经证明了威力。
写代码、操作软件、浏览网页:规则模糊,状态无限, handcrafted rules 不可能覆盖所有情况。RL 是唯一能 scalable 的方向。
第三,反馈信号天然存在。
代码能不能跑通?测试用例过不过?网页操作有没有拿到想要的结果?任务完成度是多少?这些都是天然奖励信号。
不需要人类手把手教每一个步骤,Agent 自己试错就能学。
第四,Scaling Law 的新 frontier。
大模型预训练的 Scaling Law 在放缓。高质量数据快用完了,算力成本越来越高,单纯堆参数的收益在递减。
但"推理时计算"和"RL 训练时计算"还有巨大空间。o1、o3、DeepSeek-R1 都证明:让模型多思考、多试错,效果可以超越单纯堆参数。
Sutton 说的"利用计算的通用方法",正在从预训练转向强化学习。
六、强化学习对未来 AI 的意义
强化学习不只是"一种算法"。它代表了 AI 发展的一个根本转向。
从"知识压缩"到"能力涌现"
预训练是把人类知识压缩进模型。互联网上所有的文本、代码、图片,被蒸馏成模型的参数。这是"继承"。
RL 是让模型在交互中生成新能力——策略、技巧、甚至创造力。AlphaZero 发现的棋招,DeepSeek-R1 的"顿悟时刻",都不是人类教出来的。这是"创造"。
从"静态模型"到"终身学习"
监督学习:训练一次,部署后不变。就像学生考完试,知识不再更新。
RL:部署后仍在环境中学习、适应、进化。Agent 每完成一个任务,都积累经验,下次做得更好。这更接近真正的智能。
AGI 的必经之路
真正的通用智能,不是背下所有答案,而是在未知环境中自主解决问题。
一个人到了新城市,不会因为没有"新城市生存手册"就寸步难行。他会观察、尝试、从反馈中学习。这就是 RL 的逻辑。
没有 RL,AI 永远是"考试机器"——见过就会,没见过就不会。
有了 RL,AI 才可能成为"行动者"——在未知环境中自己摸索、自己成长。
七、结语:刚刚开始
回到开篇的问题:训狗和训 AI,用的是同一套逻辑。
但有一个关键区别:狗的学习速度有限,一只狗一辈子也学不会围棋。AI 的学习速度只取决于计算资源——AlphaZero 一天下几百万盘棋,人类一辈子也下不了这么多。
这就是 Sutton 说的"利用计算"。强化学习把"试错"变成了可规模化的计算问题。给足够的计算,Agent 可以在任何环境里从零学会最优策略。
监督学习是"填鸭式教育"——给标准答案,死记硬背。
强化学习是"实践出真知"——在试错中成长,在反馈中进化。
Agentic AI 的时代,我们需要的不只是"会考试的 AI",而是"能在真实世界里活下来的 AI"。
这就是为什么,强化学习不是过时了,而是刚刚开始。
Richard Sutton 的那句话,值得再读一遍:
"The biggest lesson that can be read from 70 years of AI research is that general methods that leverage computation are ultimately the most effective."
70 年 AI 研究的最大教训是:利用计算的通用方法最终最有效。
强化学习,正是这种通用方法。