【组会分享】RFM/调参
组会分享
本页展示笔者于 2026 年 7 月 25 日进行的组会分享,内容围绕 Tron1 全身控制策略的训练、部署与实际调参经验展开。
本页从仓库结构、训练部署链路与实际调参经验出发,复盘 RFM 的工程实现。若希望进一步理解奖励函数、阶段门控与奖励融合机制,可对照阅读 【MDP】奖励函数解构学习;后者从公式与代码层面对关键 reward terms 及其组合逻辑进行拆解。两篇笔记分别对应工程实践与机制分析,可以结合阅读。
阅读说明
PDF 中的实验设置、参数与结论对应当时使用的特定代码、硬件和实验环境,仅作为研究过程记录与经验参考。复现实验前请结合当前仓库版本和设备状态独立核验。
正在载入可滑动的 PDF…
若浏览器没有显示内嵌阅读器,请使用上方的“在新窗口中打开 PDF”或“下载 PDF”。