跳转至

RLVP

第7章 · 模型后训练 · 配套项目 chapter7/RLVP

项目说明

实验 7-14:RLVP —— 奖励结果、惩罚路径

📖 本实验对应的完整训练/评估代码在独立论文仓库:github.com/19PINE-AI/rlvp

RLVP(Reward the outcome, Penalize the path)是作者团队的一项后训练研究。书中第 7 章 实验 7-14 报告的各项结果(违规率、miniF2F、全败组占比等)均来自该仓库的实验。由于训练 依赖 GPU 集群、且代码随论文持续更新,本书主仓库不再重复内置,请直接前往上游仓库获取最新 代码、配置与复现说明:

git clone https://github.com/19PINE-AI/rlvp.git

与本章其它训练类实验的关系

本目录与 chapter7/AdaptThinkchapter7/retoolchapter7/AWorld-train 等一样,属于 复现指南(KEEP-EXT):核心训练代码在外部仓库,按其 README 复现即可。书中对方法与结论的 讲解见正文第 7 章「模型后训练」相应小节。