一、项目名称
VisionLink — AI助盲眼镜系统
二、创意来源
全球有超过2.5亿视力障碍人群,日常出行面临巨大挑战。受Rokid创始人祝铭明使用Rokid眼镜+智能戒指进行演讲的启发,我们发现这套硬件组合天然适合作为视障用户的第二双眼睛。
VisionLink将Rokid AR眼镜的视觉能力与智能戒指的触觉交互结合,借助StepFun多模态AI模型,构建了一套完整的助盲系统。
三、核心功能
避障导航模式
- 利用Rokid眼镜摄像头实时检测前方障碍物
- 通过语音提示距离和方向
- 支持楼梯、台阶等高低落差检测
文字阅读模式
- 识别路牌、菜单、药品说明书等文字内容
- TTS语音朗读,支持中英文
- 自动聚焦和图像增强
场景描述模式
- AI分析当前环境并语音播报
- 红绿灯状态识别
四、硬件交互方式
Rokid CXR-L AR眼镜
- 视觉输入:摄像头采集实时画面
- 显示输出:AR投影辅助信息
- 镜腿触控:滑动切换AI模式
BLE智能戒指
- 单击:触发当前模式的AI分析
- 双击:切换模式(避障→阅读→场景)
- 长按:紧急求助
- 指向手势:引导AI分析指向方向的内容
语音控制
- 10+语音命令
- NLP模糊匹配,支持自然语言指令
- 声纹识别(ECAPA-TDNN),区分不同用户
五、技术架构
Rokid眼镜(视觉输入) → Android App(Kotlin, 6600+行代码) → AI推理引擎(StepFun API) → Rokid眼镜(AR显示)+扬声器(语音输出)
AI提供商:StepFun(阶跃星辰)
- 文本模型:step-1-flash / step-1
- 视觉模型:step-1v-8k
六、开发过程(在TRAE Work中完成)
- 项目搭建:基于现有VisionLink Android项目(v5.1.0),在TRAE Work中导入并配置开发环境
- AI提供商切换:从Moonshot迁移至StepFun,替换API端点和模型配置
- 硬件集成:整合Rokid CXR-L眼镜SDK与BLE智能戒指协议
- AI模式开发:实现避障、文字阅读、场景描述三种AI模式
- 语音控制:构建10+语音命令体系+NLP模糊匹配引擎
- 声纹识别:集成ECAPA-TDNN ONNX模型,实现用户身份区分
- 调试优化:修复通配符导入、DSL语法、依赖冲突等编译问题
七、技术亮点
- 多模态AI:视觉(step-1v-8k)+ 文本(step-1-flash)+ 语音(TTS)三模态协同
- 低延迟设计:BLE戒指触控交互响应迅速
- 离线+在线混合:声纹识别本地ONNX推理,AI分析云端调用
- 无障碍优先:全程语音反馈,无需视觉操作即可使用
- Rokid MCP接口:利用gPass合作开放的MCP接口实现拍照、语音、镜腿触控
八、应用场景
- 视障人群日常出行辅助
- 医院药房药品说明书阅读
- 餐厅菜单识别
- 交通路口红绿灯状态判断
- 公共场所标识牌识别
九、未来规划
- 接入更多Rokid MCP能力(手势识别、空间感知)
- 优化戒指手势交互(加入陀螺仪数据)
- 扩展AI模式(人脸识别、物体识别)
- 探索5G低延迟远程协助模式
- 开发iOS版本
十、开发工具
- IDE:TRAE Work
- 语言:Kotlin
- 平台:Android 12+
- AI:StepFun API
- 硬件:Rokid CXR-L眼镜 + BLE智能戒指
- 代码量:6,600+ 行
VisionLink — 让AI成为视障者的眼睛