RLVP¶
第7章 · 模型后训练 · 配套项目
chapter7/RLVP
项目说明¶
实验 7-14:RLVP —— 奖励结果、惩罚路径¶
📖 本实验对应的完整训练/评估代码在独立论文仓库:
github.com/19PINE-AI/rlvpRLVP(Reward the outcome, Penalize the path)是作者团队的一项后训练研究。书中第 7 章 实验 7-14 报告的各项结果(违规率、miniF2F、全败组占比等)均来自该仓库的实验。由于训练 依赖 GPU 集群、且代码随论文持续更新,本书主仓库不再重复内置,请直接前往上游仓库获取最新 代码、配置与复现说明:
与本章其它训练类实验的关系¶
本目录与 chapter7/AdaptThink、chapter7/retool、chapter7/AWorld-train 等一样,属于
复现指南(KEEP-EXT):核心训练代码在外部仓库,按其 README 复现即可。书中对方法与结论的
讲解见正文第 7 章「模型后训练」相应小节。