硬件交互赛道 + 灵魂伴侣——具备主动交互能力的智能桌面伴侣机器人 ![复赛]

自己 / 团队介绍

我是蓝梓轩,上海高一学生,个人参赛。

为什么想做这个作品?我从小对机器人和编程有浓厚兴趣,喜欢把物理课上学到的力学、运动控制概念和编程、机器人制作联系起来。我热爱动手实践——不是停留在看教程,而是一定要自己写代码、搭硬件,让东西真正动起来。在观察市场上的智能陪伴产品时,我发现它们普遍存在三大痛点:功能孤立(移动和AI未集成)、交互被动("命令-响应"模式)、缺乏物理实体难以建立情感联结。于是我想做一个"有温度、可触碰、懂人心"的桌面伴侣机器人。

我擅长什么?我自学了Unity3D开发、Arduino硬件编程、Python、C#等,具备跨学科整合能力。我的Vibe Coding/编程年限约2年。除了编程,我还热爱滑雪(双板高级道)、潜水(持国际OW和OWA证书)和羽毛球,拥有素描11级证书,手绘图纸精确。这些爱好锻炼了我的空间想象力、抗压能力和动手能力,也帮助我在构造机器人结构、理解运动控制时更加得心应手。

性格标签:热爱动手的科技少年、致力于全栈开发的Vibe Coder、从小做机器人的"拆家少年"。


产品简介(复赛版)

是什么

"灵伴"是一款智能桌面伴侣机器人系统(硬件机器人 + 手机App + 云端AI),解决的核心问题是:现有陪伴机器人缺乏物理实体与主动交互能力,难以建立真实的情感连接与场景化陪伴体验。

面向谁

  • 核心目标用户:家庭用户(独居老人、儿童),需要日常陪伴与智能家居控制的人群

  • 典型使用场景:居家桌面陪伴、语音聊天、日程提醒、主动问候关怀

完整功能

完整功能清单与用户使用路径:

1. 硬件层(机器人本体)

  • 四轮驱动底盘,Arduino UNO主控,桌面自由移动

  • Qi标准15W无线充电模块,支持自主回充

  • 蓝牙5.0 LE低功耗通信,与手机App实时指令传输

  • 硬件总成本仅350元

2. 手机App层(系统大脑)

  • 基于Unity3D引擎开发

  • 视觉SLAM三维空间建模与路径规划(AR Foundation)

  • 人脸检测与动态跟随(保持1-1.5米最佳交互距离)

  • 高拟真数字人形象渲染与情感动作视频播放

  • 近百种情感-动作组合(三种情绪状态 × 多种行为状态)

3. 云端AI层(智能支撑)

  • 科大讯飞SDK:语音识别(语音转文字)

  • 通义千问大模型:语义理解与对话生成

  • 火山引擎流式语音合成:情感化语音输出

用户使用路径: 开机 → 机器人自主移动至用户附近 → 主动问候(基于时间/事件触发)→ 用户语音指令 → 语音识别 → 语义理解 → AI对话/设备控制 → 情感语音回复 → 数字人动作同步播放

功能流程图简述:

Plain Text

[语音输入] → [讯飞ASR] → [通义千问LLM] → [火山引擎TTS] → [语音输出]
                                                      ↓
[SLAM导航] ← [手机App中枢] → [数字人动作视频]
     ↓                            ↓
[Arduino底盘]              [智能家居控制]

相比初赛Demo的升级

从初赛Demo到复赛成品,主要新增和打磨了以下功能:

  • 语音交互升级:从"讯飞+通义千问+豆包"串行调用改为火山引擎流式语音交互,大幅降低回复延迟,实现实时情感化语音输出

  • 数字人系统完善:从单一静态形象升级为三种情绪状态(开心/平和/难过)× 多种行为状态(待机/倾听/说话等),整合近百种表达视频

  • 导航系统优化:改进A*算法 + 动态障碍物检测,提升桌面避障能力

  • 测试体系完善:建立功能性测试、性能压力测试、用户体验评估、长期适应性测试四维评估体系


产品演示视频

演示视频已录制:展示了机器人从开机、自主移动、主动问候、语音对话、数字人情感交互、智能家居控制、自动回充的完整核心流程。

【硬件交互赛道 + 灵魂伴侣——具备主动交互能力的智能桌面伴侣机器人】 https://www.bilibili.com/video/BV1d2Tv6VEKY)


产品创作历程

灵感来源 高一物理课上学习力学和运动控制时,我联想到机器人运动,萌生了"让机器人不再是冷冰冰的工具,而是能主动靠近你、关心你的伙伴"的想法。我调研了市面上Anki Vector、Cozmo等桌面机器人,发现它们要么价格昂贵(约2000元),要么功能孤立,交互停留在"命令-响应"模式。于是决定从零设计一款低成本、高集成、具备主动交互能力的桌面伴侣机器人。

初赛Demo阶段 我搭建了"硬件平台+手机App+云端AI"三层架构。硬件方面,用Arduino UNO搭建四轮驱动底盘,集成无线充电;软件方面,用Unity开发App,集成讯飞语音识别、通义千问大模型和豆包语音合成。Demo实现了基本的语音对话和移动功能。

关键问题与解决

  1. 语音回复延迟大:最初串行调用三个API(ASR→LLM→TTS),总延迟超过5秒。后来改用火山引擎的流式语音交互,边生成边播放,延迟降至1秒以内。

  2. 手机算力有限:实时3D渲染数字人会导致卡顿。改用预生成AI视频方案,按"角色@情绪@动作@序号"命名规则管理视频资源,在保证高拟真效果的同时大幅降低计算负载。

  3. SLAM动态避障卡顿:复杂环境下动态障碍物识别及路径规划导致性能瓶颈。通过改进A*算法和优化动态障碍物添加策略缓解。

  4. 硬件成本控制:采用"感知-决策-执行"分离原则,将算力密集型任务交给手机,Arduino底盘仅做执行层,整机成本控制在350元。

重要设计与技术决策

  • "手机作大脑"架构:利用手机摄像头、算力和传感器,避免为机器人配备高价硬件,同时支持通过App更新升级功能

  • 状态机驱动的主动交互:设计情感状态机,基于时间、事件、用户行为等多源数据触发主动问候和关怀

  • 模块化硬件设计:预留升级接口,未来可通过软件升级拓展自主决策能力


TRAE 实践过程

本项目使用 TRAE 完成产品开发的完整流程如下:

开发流程总览:

  1. 需求分析与架构设计:使用 TRAE 辅助梳理需求文档、设计三层系统架构

  2. 硬件控制代码开发:使用 TRAE 辅助编写 Arduino 底盘控制、蓝牙通信协议代码

  3. Unity App 开发:使用 TRAE 辅助搭建 Unity 工程框架、SLAM导航、数字人视频管理、情感状态机等核心模块

  4. AI 接口集成:使用 TRAE 辅助集成讯飞语音识别、通义千问LLM、火山引擎TTS等API

  5. 测试与调试:使用 TRAE 辅助编写测试用例、分析日志、定位Bug

关键开发步骤截图(不少于3张):

关键任务对话的 Session ID(不少于3个):

在 TRAE 中完成以下开发任务的实际 Session ID

  1. Unity 工程框架搭建与数字人系统开发 — Session ID: ___2913080246273209:92c8fdeee559f3f2c67f7e8e8fefb17e_6a5f58198dad856076a63eb8.6a60de994e265d0137e095c4.6a60de994e265d0137e095c3:TRAE Work CN.0.1.39.no_sid.no_ppe.T(2026/7/22 23:16:27)___
  1. Arduino 底盘控制与蓝牙通信协议开发 — Session ID: _2913080246273209:2f2b5f48bdc93f58355958dddc9aedd4_6a4661e1da93be451ee3eb7c.6a63850d4e265d0137e0c565.6a63850d4e265d0137e0c563:TRAE Work CN.0.1.39.no_sid.no_ppe.T(2026/7/24 23:30:21)__
  1. AI 语音交互流水线集成(ASR→LLM→TTS) — Session ID: _2913080246273209:88c5387f2fff177366b1fa779493252b_6a676ac7664033c0947220ac.6a6c08ee71783819efa6ac25.6a6c08ec71783819efa6ac23:TRAE Work CN.0.1.39.no_sid.no_ppe.T(2026/7/31 10:31:10)__
  1. SLAM 导航与避障算法实现 — Session ID: _2913080246273209:f6671b23774a46d55a462648e5f64186_6a676ac7664033c0947220ac.6a6a108cafdebf1d5bcdddba.6a6a108cafdebf1d5bcdddb8:TRAE Work CN.0.1.39.no_sid.no_ppe.T(2026/7/29 22:39:08)__