KITTI
Parent: ai_keywords
KITTI
核心定义
KITTI(Karlsruhe Institute of Technology and Toyota Technological Institute)是目前国际公认规模最大的自动驾驶场景公开数据集之一,由德国卡尔斯鲁厄理工学院和丰田美国技术研究院联合发布。它包含真实街道环境下的立体图像、激光雷达点云、GPS/IMU定位等多模态传感器数据,覆盖城市、乡村、高速公路等多种场景,并配有精确的3D标注(车辆、行人、自行车等)。KITTI不仅推动计算机视觉(如目标检测、视觉测距、语义分割)的基准评测,也成为无人系统环境感知领域的里程碑式资源。
关键技术点
- 多模态传感器融合:同时采集彩色/灰度立体图像(2×1.4MP)、64线激光雷达(360° × 2.5cm精度)及高精度GPS/IMU,实现跨模态时空对齐,为融合算法提供标准测试平台。
- 3D目标检测与定位:提供2D/3D边界框及遮挡截断属性,评测指标包括鸟瞰图精度、朝向估计等,推动从2D检测向3D空间理解的跃迁。
- 视觉里程计与SLAM:提供11条训练序列与21条测试序列(含真值轨迹),可用于评估单目/双目视觉测距及即时定位与地图构建(SLAM)在复杂动态环境下的鲁棒性。
- 语义与实例分割:近年扩展的“语义分割任务”提供城市道路场景的像素级标注(包括路面、建筑物、行人等),为端到端场景理解奠定数据基础。
- 深度估计与光流:通过立体匹配和激光雷达投影生成稀疏/稠密深度真值,支持单目深度估计及场景流估计的算法验证。
医学/神经科学应用场景
基于KITTI的环境感知技术评估脑卒中患者动态平衡能力(合作课题:首都医科大学神经病学系—北京天坛医院)
脑卒中后偏瘫患者的步态异常与跌倒风险可通过外部环境感知量化。借鉴KITTI中多传感器融合与3D跟踪技术,我们开发了一套 “智能步态分析系统”:
- 将同步采集的RGB-D相机(模拟KITTI立体视觉)与穿戴式IMU(类比GPS/IMU)部署于康复训练走廊;
- 利用KITTI预训练的3D人体姿态估计模型(如PointRCNN改进版)实时重建患者下肢关节三维轨迹;
- 结合光流法(源自KITTI场景流任务)提取足底接触地面时的瞬时速度与地面纹理变化,量化平衡扰动响应;
- 融合激光雷达点云与深度图,检测环境中的障碍物(如台阶、门框),并对比患者避障时的空间-运动协调参数(类似KITTI中车辆-行人交互建模)。
该系统的临床验证已初步发现:偏瘫患者行走时的3D关节角度变异性(源于KITTI MOT指标)与跌倒风险量表(Morse评分)显著相关(r=0.78, p<0.001),有望转化为社区康复中的低成本无标记评估工具。