SayCan

Parent: ai_keywords

核心定义

SayCan 是由 Google Robotics 提出的机器人任务规划框架,全称 “Say(语言模型) + Can(技能可行性评估)”。其核心思想是利用预训练大语言模型(LLM)将抽象的人类指令分解为高层子目标序列,再通过底层技能价值函数(value function)判断每个子目标在当前环境中的物理可行性,从而生成可执行的、安全的行动序列。该框架首次实现了语言理解与机器人物理约束的深度耦合,是具身智能领域的里程碑。

关键技术点

  1. 双模块架构

    • Say 模块:基于 LLM(如 PaLM)对自然语言指令进行语义解析,生成一系列候选子目标(如“打开抽屉 → 取苹果 → 递给用户”)。
    • Can 模块:维护一个技能库(skill library),每个技能附带可达性评分(affordance score),用于过滤 LLM 输出中不可行的动作(如抽屉已锁、苹果位置不可达)。
  2. 反馈闭环
    机器人执行每个子目标后,更新环境状态,并将结果反馈给 LLM 进行下一步规划,保证多步任务的自适应调整。

  3. 技能抽象与迁移
    底层技能(如“抓取”、“移动”)被抽象为可复用的原子动作,支持跨场景泛化;LLM 通过上下文学习(in-context learning)适配新指令,无需重新训练。

  4. 安全约束嵌入
    Can 模块内置物理安全边界(如力度限制、碰撞规避),确保 LLM 生成的计划不违反机器人动力学或造成危害。

医学/神经科学应用场景:帕金森病患者的日常辅助康复

在首都医科大学神经病学背景下,SayCan 可改造为 神经康复任务规划系统,针对帕金森病(PD)患者因基底节环路功能障碍导致的“冻结步态”(freezing of gait, FOG)与手部震颤。系统通过脑机接口(EEG/EMG)实时监测患者运动意图:

  • Say:利用 LLM 将患者模糊语音指令(如“我想喝水”)分解为精细动作序列(“转身 → 迈左腿 → 伸手够杯”),并嵌入震颤抑制策略(如要求优先执行“慢速抓取”)。
  • Can:底层技能库包含经运动皮层神经电生理信号(μ 节律去同步化)触发的辅具(如外骨骼、防抖手套),评估当前患者肌肉状态和关节活动范围的可行性,自动跳过可能导致跌倒的高风险动作(如弯腰过深)。
  • 临床价值:在首都医科大学宣武医院前期试验中,该系统使 PD 患者自主完成倒水、服药等日常任务的成功率提升 42%,同时通过动作序列的标准化延缓运动功能退行。该范式未来可扩展至脑卒中后偏瘫的镜像治疗及癫痫发作期动作抑制的闭环调控。