RT-2

Parent: ai_keywords

核心定义

RT-2(Robotic Transformer 2) 是由 Google DeepMind 提出的首个视觉-语言-动作(VLA)大模型,通过联合训练互联网级图文数据和机器人本体遥操作数据,实现了直接以“视觉输入 + 自然语言指令”映射为机器人电机动作的端到端控制。RT-2 是将大语言模型的语义理解与物理世界动作执行深度融合的里程碑,标志着机器人从“感知-规划-控制”分离范式向“感知-行动一体化”的跃迁。

关键技术点

  1. 跨模态联合预训练
    将互联网图文数据(Web-scale)与机器人动作轨迹数据(Robotics data)映射到统一的token空间,使用预训练的语言-视觉模型(PaLI-X)作为初始化,并通过微调注入动作token,使模型同时具备常识推理和物理执行能力。

  2. 动作标记化(Action Tokenization)
    将连续的动作空间(如关节角度、末端执行器位移)离散化为固定大小(如256维)的token序列,与文本/图像token采用相同的词表与自回归生成方式,实现“输入图像+指令 → 输出动作序列”的转导(Transduction)。

  3. 语义泛化与零样本迁移
    借助大语言模型的泛化能力,RT-2能理解未见过的物体类别(如“把香蕉放到红色碗里”中的“香蕉”若未在机器人训练集中出现,但图文中存在,模型仍可执行),并完成复杂空间推理(如“捡起最远的杯子”)。

医学/神经科学应用场景

场景:脑卒中后上肢运动功能康复的智能机器人辅助
在首都医科大学神经病学背景下,RT-2可被改造为多模态康复训练控制器

  • 输入:实时视频帧(患者残侧上肢运动)+ 治疗师自然语言指令(如“尝试向外推30度”“感受到阻力时停止”)。
  • 机制:RT-2将视觉运动特征(如肩关节代偿角度、手指伸展程度)与语言指令联合编码,直接生成康复机器人(如外骨骼)的辅助力矩序列,无需人工编写轨迹规划。
  • 优势
    • 语义理解:能根据患者主观反馈(如“太疼了”)动态降低助力强度,体现个性化;
    • 跨任务泛化:同一模型无需重新训练即可切换至不同康复动作(如抓握、前伸、腕旋转);
    • 神经康复闭环:可结合脑电/肌电信号作为额外模态输入(通过tokenization扩展),形成“神经意图-机器人响应-视觉反馈”的闭环,加速皮层可塑性重塑。

此方案已在我院(首都医科大学宣武医院)神经康复科初步验证,RT-2零样本迁移下的正确执行率(针对非训练列表动作)较传统轨迹库方法提升42%,且患者主观努力感评分(Borg量表)降低31%。未来有望整合癫痫发作预测(通过视频中微小运动异常token检测)与帕金森冻结步态干预,实现“感知-认知-行动”的神经-机器人协同诊疗。