AI Passport 最被低估的玩法不是当身份牌,也不是刷小游戏,而是 ——当一个别在胸口的 Trae 语音遥控器。
痛点: 通勤路上突然想到一个 bug 怎么修、开会时需要让 AI 帮你重构一段代码、躺在床上冒出个项目灵感 —— 你不想坐到电脑前,但电脑上的 Trae 正开着、项目正加载着、上下文都在。缺的只是一个「不用坐在电脑前,也能给 Trae 发指令」的入口。
创意: 把 AI Passport 变成一个语音遥控器。按住胸牌说话,指令通过 Wi-Fi 发到自托管服务器,服务器转成文字后推给电脑上正在运行的 Trae,Trae 收到后直接在你的项目里写代码、改文件、跑命令。你人在外面,电脑在家帮你干活,完成后胸牌语音播报结果。
交互流程:
- 按住胸牌侧键说话:“把 user 模块里的登录函数加上参数校验,再写两个单元测试”
- 彩屏显示「
聆听中」,松开后显示「
发送中…」 - 胸牌通过 Wi-Fi 把音频流发到自托管服务器,服务器做 STT 转文字
- 服务器把文字指令通过 MQTT/WebSocket 推给电脑上的 Trae 扩展
- Trae 扩展调用 AI Chat/Builder 能力,在当前项目里自动改代码、跑测试
- 完成后结果回传服务器,服务器 TTS 转语音,胸牌扬声器播报:“已完成,修改了 3 个文件,测试全部通过”,彩屏显示

- 手机端(可选)通过 MQTT 订阅对话数据,展示完整的代码变更 diff、终端输出、Trae 回复摘要
技术架构(三层,官方固件零改动):
- 终端层(Passport 胸牌):官方固件不改一行代码。AI Passport 原生支持「麦克风采集 → Wi-Fi 上传音频流 → 接收音频流 → 扬声器播放」的完整语音链路,这是 FoloToy 固件的核心能力。3 枚按键中一枚默认就是 PTT 按住说话,彩屏可以显示状态图标。它只负责「说」和「听结果」,不做任何重计算,500mAh 电池日常佩戴够用。
- 中转层(自托管 FoloToy Server):官方提供 Docker 一键部署的自托管服务器,原生支持 STT(Whisper / 阿里云 / Azure)、LLM(OpenAI 兼容接口,可接任意模型)、TTS(Edge TTS / OpenAI TTS / 阿里云)。关键是 ——所有对话数据自动发布到 MQTT Broker,外部程序可以订阅。我们在这里做一件事:不接通用聊天 LLM,而是把 STT 转出来的文字通过 MQTT 转发给电脑上的 Trae 扩展;Trae 执行完的结果文字回传服务器,服务器调 TTS 转语音回给胸牌播放。这一层是纯配置 + 一个轻量转发脚本,不需要改服务器核心代码。
- 执行层(电脑上的 Trae 扩展):这是核心,也是最不需要担心的一层。Trae 官方提供完整的扩展 API——AI Chat API、Code Generation API、Commands API,完全兼容 VS Code 扩展生态。写一个 Trae 扩展做三件事:①启动 MQTT 客户端订阅指令话题;②收到文字后调用
chatSession.sendMessage()把指令丢给 Trae 的 AI,AI 自动改代码、跑终端命令;③把执行结果摘要(改了哪些文件、终端输出、是否成功)发布回 MQTT。除此之外还有更简单的替代路径:官方 TraeCode CLI 可以在终端直接调用 Code Agent,脚本里exec一下就行;也可以用 MCP 协议把 Trae 的 SOLO Agent 暴露出来调用。社区里已经有dsh-trae-api、Pi IDE Bridge等开源项目在做「外部程序 ↔ Trae」的桥接,说明这条路完全走得通。
为什么只有 AI Passport 能做这个遥控器: 它刚好集齐了「麦克风 + 扬声器 + Wi-Fi + 可穿戴 + 物理 PTT 按键 + 彩屏状态反馈 + 原生语音 AI 链路」这七要素。手机也能语音遥控,但你要掏出来、解锁、打开 App;胸牌别在衣服上,抬手一按就能说,这是「随时可用」和「想起来才用」的区别。而 ESP32-C3 的弱算力在这里反而是优势 —— 它不需要本地跑模型,只做音频采集和 Wi-Fi 传输,功耗极低。
和「云端 AI 写代码」的本质区别: 云端方案是让 AI 在真空里生成代码,没有你的项目上下文,写完还得手动拷回电脑。这个方案是让你电脑上的 Trae 干活 —— 它理解你的整个代码库,知道你的依赖、你的命名规范、你的 git 状态,改完直接落在你的项目里。你人不在电脑前,但电脑上的 Trae 和你坐在前面时一模一样。