ch1
- 仿真在训练闭环中的三个角色是什么?第一个是指物理世界本身?比如说根据机器人做出的决策去计算物理世界的下一个状态?比如说机器人决策是往前走一步,给腿部电机输出了下一个时刻的位置(并且在电机或者说关节轴上产生了力矩),然后物理世界就会根据物理信息计算出下一个时刻的腿部位置?第二个指的是agent本身?也就是如何基于MDP进行学习的过程?获取环境信息并且进行决策?比如说这一步中收集观测,制定决策,进行学习等等;第三个调试仪器就是获取特权信息(或者仿真世界中的真实物理状态?)的吗?感觉名字有一些拗口
- Sim-to-Real Pipeline 概览中,Teacher-Student蒸馏的需要原因感觉不太对?实际上这个过程中训练了两个agent,一个是教师agent,可以获取很多上帝视角下的信息,如地面摩擦系数、地形信息(可能使用高程图给出),这些在真实环境下是无法获取的,在仿真中可以获取,这样教师agent可以更快的学会如何在复杂和困难的环境下进行决策(如崎岖地形下的稳定行走),然后学生agent则更像是真实世界下的机器人,只能获取本体状态和传感器数据(都带有噪声),蒸馏的过程就是学生必须模仿教师的决策与对环境的理解,也就是必须通过自身可以感知的数据去反向推断环境的数据,这才是蒸馏的意义和价值
- 在1.2章节 GPU 并行仿真的核心思想中,GPU范式似乎非常类似于Pytorch等框架的张量存储与计算形式?同时GPU并行范式小节可以更详细讲解一下,数据布局小节也是,因为我不是很懂张量形状与底层数据结构的关联
- 在端到端 GPU 训练的数据流小节中,这个表格有些奇怪?是不是数据流表达的格式有问题?
- 几种物理引擎中,广义坐标/笛卡尔坐标等有什么区别?各自是什么定义
- 在1.3节的生态演进中,似乎没有提到Mjlab?还是说这个与MJX框架有关系?第四阶段的MuJoCo Playground与Mjlab的关系是什么?是否需要改成Mjlab的演进内容?ASAP(RSS'25)论文又是哪一个论文?
- 在1.4的工程决策树中,似乎并不能说需要对比多种RL算法就选择IsaacLab?因为SB3/RSL-RL等只是库的不同,内部的算法可能都是一样的?然后Mjlab的独特设计中Entity是什么?似乎没有说明?MJCF是模型文件类型吗?