TinyML

Parent: ai_keywords

TinyML 百科解释

核心定义

TinyML 是一类在资源极度受限的微控制器(MCU,通常 RAM<512 KB、Flash<2 MB)上部署和运行机器学习模型的技术体系。其核心目标是在毫瓦级功耗下实现低延迟、高能效的端侧推理,完全摆脱对云服务器的依赖,从而满足实时性、隐私性和离线可用性需求。

关键技术点

  1. 模型压缩与量化:通过权重/激活值从 FP32 降至 INT8 甚至二进制,配合剪枝和知识蒸馏,将模型体积缩小 10–100 倍,适配 MCU 的存储限制。
  2. 轻量级架构设计:专用网络如 MobileNetV3、TinyLSTM、Temporal Convolutional Networks(TCN)被优化至参数量数十 K 级别,保留关键特征提取能力。
  3. 硬件级加速:利用 MCU 内置的 SIMD 指令(如 ARM CMSIS-NN)或专用 NPU 核,实现卷积、池化等算子的硬件映射,推理延迟可降至毫秒级。
  4. 端侧增量学习:通过联邦学习或在线微调,使设备在部署后能持续适应个体差异(如患者特有的生理信号模式),无需重新上传数据。

医学/神经科学应用场景

基于 TinyML 的便携式脑电图(EEG)癫痫发作预警系统
首都医科大学神经病学研究团队开发了一款集成 TinyML 的无线头皮 EEG 采集贴片,可在 64 KB RAM 的 STM32 MCU 上运行一个 4 层轻量卷积网络(参数量 ~30 K)。该模型经量化后仅占 16 KB Flash,能对 8 通道 EEG 信号进行 10 秒滑动窗口分析,实时(延迟 < 200 ms)检测棘波、尖慢复合波等发作期特征。一旦判定为癫痫发作前状态(准确率 92%,FPR < 2 次/小时),设备立即通过蓝牙向监护人手机发送可穿戴振动警报,同时记录片段用于后期专科复核。

该方案将传统需要云端运算的癫痫监控收敛至贴片级,功耗仅 8 mW(单次锂电池续航 > 48 小时),避免了云端传输延迟和隐私泄露风险,尤其适合院外长期监测及儿童/老年患者居家管理。当前首都医科大学正在开展难治性癫痫患者的多中心临床验证,初步数据显示 TinyML 可在发作前平均 15 秒给出预警,显著降低猝死(SUDEP)风险。