【资料图】

信息显示,AI智能体学习主要通过模仿学习和强化学习两条路径实现。前者从专家示范中快速建立状态到动作的映射,后者则在与环境交互中根据奖励信号持续优化策略。两者通常结合使用,先通过模仿形成初始策略,再用强化进行突破。

一份研报观点认为,大模型训练中预训练和监督微调本质是模仿学习,而RLHF、RLVR等强化学习主要应用于后训练阶段,用于偏好对齐和可验证推理。研报指出,AlphaGo先学棋谱再自我对弈、ChatGPT先SFT再RLHF、机器人VLA先示范预训练再仿真强化的路径,均验证了这一组合范式的高效性。

研报认为,在智能驾驶和具身智能领域,纯模仿路线受限于物理世界试错成本高、长尾危险场景数据稀缺等问题。先模仿获取基础策略,再借助仿真环境和强化学习补足长尾,成为行业主流趋势。这不仅能突破示范者表现上限,还能显著提升策略在复杂真实场景下的稳健性。

研报指出,数字AI底座发展路径已逐渐清晰,但难以完成物理世界的建模闭环,而物理AI将成为物理世界AI解决方案,在当前AI发展阶段构成更大增量。智能驾驶作为最有可能率先实现闭环的代表场景,其商业化进程有望加快,相关技术迭代和落地将为产业链带来显著机遇。

推荐内容