【硬件交互赛道】盲人的”第三只眼“——能主动避障寻路、实时导航、找物抓取的低成本便携式AI助盲眼镜

1. 创意名称 + 创意介绍

创意名称:盲人的”第三只眼“——AI助盲眼镜

我们想解决的是盲人和视障朋友在独立出行、找路、避障、找物和理解周围环境时缺少实时可靠辅助的问题。

做这个项目的动机,来自我们了解到盲人朋友出行非常不容易,也看到不少 AI 眼镜相关评论都提到“其实盲人才最需要 AI 眼镜”。现在AI工具的发展让我们可以拥有软硬件工程师的全栈能力,因为Trae让这一切变得可能,让技术普惠到每一个人才是技术的意义。

经过调研,目前市面上很多导航 App 只能告诉用户“往哪里走”,但不能实时判断眼前哪里能走、脚下有没有危险、物体在哪里、手是否能够到。而且大部分 AI 眼镜也主要面向普通大众,不是围绕盲人导航、避障、找物和持续反馈专门设计的,都是一问一答式对话,没有实时性。在盲人行进中,如若危险来临,没有实时性的AI眼镜能提供的辅助非常有限。

而且大部分AI硬件,AI眼镜价格昂贵,动辄几千元的价格很难让视障人群受益。

基于以上的观察,我们希望做出一款专门为盲人朋友设计的,能实时主动辅助盲人出行寻物,具有强大智能,真的能够给视障朋友”重获视力“的体验,并且成本仅300元的盲人的”第三只眼“ !——AI助盲眼镜

这个产品是一套“AI 眼镜 + 手机 App + 云端智能体”的硬件交互系统。眼镜负责摄像头、麦克风、扬声器、IMU、TOF 和震动反馈;手机负责本地导航、YOLO 视觉识别和多传感器融合;云端负责语音意图理解、视觉问答、用户自定义360 环境识别、万物监测、联网搜索和定时提醒。

2. 目标用户及痛点

核心用户是盲人、低视力人群,以及在部分场景下需要视觉辅助的人群。我们最关注的是盲人朋友的日常独立行动:从家里走到地铁站、在人行道上寻找可通行区域、接近路口时判断斑马线和红绿灯、避开脚下坑洞或近距离障碍,也包括在室内寻找水杯、钥匙、门把手等常用物品并引导去拿取。以及让用户可以自定义来使用AI眼镜,比如让眼镜用什么的频率,时长持续监测前方是否有人或车辆、水是否烧开等需要持续反馈监测的场景、定时提醒喝水吃药或播报信息、定时联网搜索信息。

目前这些场景往往需要用户同时依赖盲杖、手机导航、路人帮助和个人经验。盲杖能探测近处地面,但无法理解红绿灯、斑马线和远处通路;手机导航能给出宏观路线,却不知道眼前哪里能走;普通 AI 眼镜更多是“拍一张图、回答一句话”,无法在行走过程中持续、低延迟地给出方向和安全提示。更不能在弱网场景下稳定承担导航安全闭环。

对盲人来说,真正困难的不是单次识别“前方有什么”,而是在连续移动中实时知道“该往哪边走、哪里不能走、什么时候该停下、物体在什么方向、手能不能够到”。这要求系统既要有地图导航,又要有视觉通路识别,还要有近距离安全传感器兜底。

因此本项目特别强调端侧实时性:导航主链路基本完全在手机本地完成,ESP32 眼镜端通过 WiFi 与手机直连传输摄像头、IMU 和 TOF 数据,云端只做日志、回放和调试,不参与实时安全决策。这样即使云端网络抖动,也不会影响本地避障、通路寻找和导航引导。

3. 核心功能亮点

产品不仅能语音问答,更重要的是能主动给盲人朋友提供实时、可执行、低成本的行动辅助:

低成本高性价比:我们希望把这款 AI 助盲眼镜的硬件成本控制在约 300 元,让真正需要 AI 眼镜的视障人群也能用得起,而不是停留在几千元高价 AI 硬件的小众体验里。它不是削弱能力换低价,而是通过 ESP32-S3、手机本地算力和云端智能体分工,把成本、实时性和智能能力做平衡。

端侧实时导航与避障:导航主链路基本在手机本地完成,ESP32 眼镜端通过 WiFi 直连手机传输摄像头、IMU 和 TOF 数据,不耗费用户手机移动流量,云端不参与实时安全决策,也因此不会因为云端网络抖动影响避障和寻路。用户行走时,系统可以在端侧语音提示“左转、右移、保持直线、停下、寻找斑马线、红灯请等待”等。

宏观地图 + 微观视觉 + 安全传感器三层融合:高德地图负责路线意图和宏观方向,告诉用户大方向和是否接近路口;YOLO Seg 负责识别人行道可通行区域 pass、斑马线 crossing 等中心线,告诉用户眼前哪里能走、如何左移右移保持通路;TOF的8×8点阵负责脚下近距离危险兜底、 9 轴IMU提供的绝对朝向与高德路径方向做差值计算,用来进行起步对准和偏航纠偏。系统先保证安全,再保证方向正确,最后给出简短可执行的实时引导。

自研 YOLO 视觉模型:我们使用万张级自收集、自打标的户外出行数据集,经过多轮训练和调优,在手机端运行 YOLO nano 分割/检测模型,实时识别人行道通路、机动车道、非机动车道、红绿灯、斑马线和障碍物。这个过程非常耗时,也是核心壁垒之一,让眼镜不只是“能看图”,而是能更实时地理解“眼前哪里能走、哪里不能走、是否到了路口、能否过马路”。

找物与抓取辅助:通过 AI 模型识别目标物体位置,引导用户转头、对准、靠近,并结合距离判断目标是否已经进入手可触达范围,进一步提示用户向左、向右、向前或伸手抓取。

用户自定义持续反馈:用户可以说“帮我盯着门口,有人来了提醒我”“看看水有没有烧开”“持续观察前方有没有公交车”,系统会持续采集和分析,不只是单次回答。也可以进行 360 环境识别、定时提醒、联网搜索和信息播报。

多模态反馈:除语音播报外,最终产品形态还支持左右震动反馈,用户可以选择声音、震动或二者结合来接收方向提示,减少复杂场景下的听觉负担。

4. 价值与意义

从社会价值看,我们希望用技术实实在在地帮助盲人和视障朋友,也希望通过这个项目让更多人看见他们日常生活中的不容易。很多困难如果没有亲身体验,很难被普通人感受到:出门、过马路、找物、判断周围环境,对视障朋友来说都可能是一连串需要高度紧张应对的挑战。

因此这个项目的意义不只是做一款 AI 硬件,也是在用一个真实可体验、可展示、可迭代的产品形态,让更多人关注到弱势群体在现实生活中的具体困境。AI 不应该只停留在屏幕里的聊天窗口,也不应该只成为少数人尝鲜的高价消费电子。它应该走进真实的物理生活,进入出行、家庭、街道、路口这些具体场景,真正帮助那些最需要技术支持的人。

从公益价值看,我们希望这款 AI 助盲眼镜成为一种低成本、高性价比、可持续迭代的普惠方案。技术发展的意义不只是让普通人更方便,也应该让盲人和视障朋友获得更多独立行动的可能,减少对路人帮助的依赖,提升出行和日常生活中的安全感与尊严感。

从技术落地价值看,项目的关键不是“把大模型接到眼镜上”,而是把 AI 视觉、地图导航、IMU/TOF 传感器、语音播报和震动反馈整合进一个真实可佩戴的软硬件系统,在用户连续移动中判断哪里能走、什么时候该停、物体在什么方向,并给出简短、清晰、可执行的反馈。它让 AI 从回答问题变成参与现实世界的辅助行动,让技术真正对人的生活产生改变。

5. 外观自主设计

目前 MVP 原型为自主建模 + 3D 打印打样,整体为流线型类环状设计,强调简洁的科技美感。采用无镜片额梁式镜架,前部集成摄像头和 TOF 等传感器,镜腿内预留主板、电池、扬声器、麦克风和左右震动马达的安装空间,外观和功能是一起设计的,不是简单给开发板套壳。

6. 硬件与最终产品形态

最终产品硬件为自研 PCB 和 FPC,计划采用 ESP32-S3R8,Flash 16MB,PSRAM 8MB,硬件能力不低于 ESP32-S3 Sense。眼镜端集成摄像头、麦克风、扬声器、IMU、TOF、WiFi、蓝牙和左右震动反馈模块。

当前原型已验证 ESP32 内建 Web 服务器、WiFi、摄像头、TOF、IMU、蓝牙等基础外设链路。后续会根据固件体积评估是否升级更大 Flash,以支持 OTA、AB 分区、日志、历史记录和更多本地功能。

7. 创意产物 HTML 文件

AI助盲眼镜创意方案 -v2.html (1.4 MB)