【硬件交互赛道】VisionLink — AI助盲眼镜系统:Rokid眼镜+智能戒指+StepFun多模态AI

一、项目名称

VisionLink — AI助盲眼镜系统

二、创意来源

全球有超过2.5亿视力障碍人群,日常出行面临巨大挑战。受Rokid创始人祝铭明使用Rokid眼镜+智能戒指进行演讲的启发,我们发现这套硬件组合天然适合作为视障用户的第二双眼睛。

VisionLink将Rokid AR眼镜的视觉能力与智能戒指的触觉交互结合,借助StepFun多模态AI模型,构建了一套完整的助盲系统。

三、核心功能

避障导航模式

  • 利用Rokid眼镜摄像头实时检测前方障碍物
  • 通过语音提示距离和方向
  • 支持楼梯、台阶等高低落差检测

文字阅读模式

  • 识别路牌、菜单、药品说明书等文字内容
  • TTS语音朗读,支持中英文
  • 自动聚焦和图像增强

场景描述模式

  • AI分析当前环境并语音播报
  • 红绿灯状态识别

四、硬件交互方式

Rokid CXR-L AR眼镜

  • 视觉输入:摄像头采集实时画面
  • 显示输出:AR投影辅助信息
  • 镜腿触控:滑动切换AI模式

BLE智能戒指

  • 单击:触发当前模式的AI分析
  • 双击:切换模式(避障→阅读→场景)
  • 长按:紧急求助
  • 指向手势:引导AI分析指向方向的内容

语音控制

  • 10+语音命令
  • NLP模糊匹配,支持自然语言指令
  • 声纹识别(ECAPA-TDNN),区分不同用户

五、技术架构

Rokid眼镜(视觉输入) → Android App(Kotlin, 6600+行代码) → AI推理引擎(StepFun API) → Rokid眼镜(AR显示)+扬声器(语音输出)

AI提供商:StepFun(阶跃星辰)

  • 文本模型:step-1-flash / step-1
  • 视觉模型:step-1v-8k

六、开发过程(在TRAE Work中完成)

  1. 项目搭建:基于现有VisionLink Android项目(v5.1.0),在TRAE Work中导入并配置开发环境
  2. AI提供商切换:从Moonshot迁移至StepFun,替换API端点和模型配置
  3. 硬件集成:整合Rokid CXR-L眼镜SDK与BLE智能戒指协议
  4. AI模式开发:实现避障、文字阅读、场景描述三种AI模式
  5. 语音控制:构建10+语音命令体系+NLP模糊匹配引擎
  6. 声纹识别:集成ECAPA-TDNN ONNX模型,实现用户身份区分
  7. 调试优化:修复通配符导入、DSL语法、依赖冲突等编译问题

七、技术亮点

  • 多模态AI:视觉(step-1v-8k)+ 文本(step-1-flash)+ 语音(TTS)三模态协同
  • 低延迟设计:BLE戒指触控交互响应迅速
  • 离线+在线混合:声纹识别本地ONNX推理,AI分析云端调用
  • 无障碍优先:全程语音反馈,无需视觉操作即可使用
  • Rokid MCP接口:利用gPass合作开放的MCP接口实现拍照、语音、镜腿触控

八、应用场景

  • 视障人群日常出行辅助
  • 医院药房药品说明书阅读
  • 餐厅菜单识别
  • 交通路口红绿灯状态判断
  • 公共场所标识牌识别

九、未来规划

  • 接入更多Rokid MCP能力(手势识别、空间感知)
  • 优化戒指手势交互(加入陀螺仪数据)
  • 扩展AI模式(人脸识别、物体识别)
  • 探索5G低延迟远程协助模式
  • 开发iOS版本

十、开发工具

  • IDE:TRAE Work
  • 语言:Kotlin
  • 平台:Android 12+
  • AI:StepFun API
  • 硬件:Rokid CXR-L眼镜 + BLE智能戒指
  • 代码量:6,600+ 行

项目仓库:GitHub - cpufreestyle/visionlink-android: VisionLink Android - Gemma 4 E2B offline AI assistant for the blind 导盲ai眼镜 · GitHub

VisionLink — 让AI成为视障者的眼睛

1 个赞

你的投稿板块错了

1 个赞

发错板块了

1 个赞

板块错了,也发重复了吧?

1 个赞