核心概念
统一术语,避免同一个东西在不同页面叫不同名字。
模型相关
BFM : Behavior Foundation Model,行为基础模型。在大规模行为数据上预训练,学到的不是单个技能而是一个行为空间——下游用少量数据就能从中调出想要的那个行为。是所有技能的共同起点。
策略(Policy) : 从观测映射到动作的函数。在本工具链里,一个「技能」交付出来的产物就是一个策略。
后训练(Post-training) : 在 BFM 预训练权重之上继续训练,使其适配特定技能或特定本体。区别于从随机初始化开始的「从零训练」。
观测(Observation) : 模型每个控制周期读到的输入,通常包含关节位置/速度、IMU、上层指令等。完整字段见 数据格式。
动作(Action) : 模型每个控制周期输出的量。注意它一般不是力矩,而是下发给底层控制器的参考值,具体含义见 数据格式。
数据相关
轨迹(Trajectory / Episode) : 一次连续录制的数据,从任务开始到结束。数据集的基本单位。
演示(Demonstration) : 由人通过遥操作产生的轨迹,是后训练的主要数据来源。
时间对齐 : 把不同传感器、不同采样率的数据统一到同一时间轴上。做不好会直接毁掉训练效果,见 数据准备。
部署相关
本体(Embodiment) : 一台具体的机器人,包含它的关节构型、限位、传感器配置。同一个 BFM 适配不同本体需要额外工作。
控制频率 : 策略输出动作的频率。它和底层伺服环的频率通常不同,两者的关系见 部署使用。
Sim2Real : 把仿真中训好的策略迁移到真机,并处理两者之间差距的一整套方法。见 推理部署。
域随机化(Domain Randomization) : 训练时随机扰动仿真参数(质量、摩擦、时延等),让策略对真机的参数偏差更鲁棒。
标注约定
文档里用这几个标记区分运行环境:
- 仿真 —— 只在仿真中验证过
- 真机 —— 已在真机上验证
- 模型 —— 与模型权重强相关,换版本需重新确认
- 待补充 —— 内容尚未填写