【学习工作赛道】ai-chat-collector —— 把 AI 对话变成你的第二大脑 | 一款Chrome浏览器扩展
0. 先和大家打个招呼 
Hi! 我是shwsq,某某大学2026届本科毕业生,非计算机专业。
我的作品是一个插件,名为ai-chat-collector。基本上百分之99以上的代码由TRAE所写。
先把插件录屏展示放上来!诚邀各位点击看看效果!
![]()
1. Demo 简介
是什么:一个 Chrome 浏览器扩展(MV3),把你在各 AI 平台的对话自动采集下来,转化为可语义搜索、可问答的个人知识库(RAG)。
面向谁:重度使用 AI 对话的学习者、研究者、开发者——每天跟多个 AI 平台深度交流,希望把散落在各处的对话沉淀为可复用知识的人。
已上传github: https://github.com/shShwsq/web-ai-chat-collector
(如有任何问题和建议,期待您直接在github告知我)
主要功能:
-
多平台对话采集 — 支持 DeepSeek / 千问 / 复旦智汇岛 / 豆包 / Kimi 五个平台,自动提取用户提问、AI 回答、深度思考过程和联网搜索引用,完整保留 Markdown 格式(表格、代码块、KaTeX 公式)。
-
基础搜索 + 语义搜索 + AI 问答(RAG) — 对话被切片嵌入为向量,支持按语义检索;页面悬浮问答球可基于你的历史对话回答问题、整理笔记、生成测验,三种模式均流式输出。(我个人最喜欢“生成测验”这个功能,也是上面的录屏里所展示的
) -
SKILL 集成 — 配套 SKILL 让 TRAE、OpenClaw、Cursor 等外部智能体直接语义检索你的知识库,把「个人对话历史」变成可被 Agent 调用的长期记忆。(此功能需配置向量库,我在docs的文档里详细说明了各种向量库的配置方式,供大家查阅)
「仅采集用户本人数据 / 本地优先存储 / 可选远程同步 / 网络拦截主动请求仅作采集完整性辅助手段 / 无用户行为模拟」
(默认只开启复旦智汇岛平台对话自动提取,其它平台需用户在设置中点击开启)
图片就不多放了,欢迎下载 web-ai-chat-collector.zip 体验本浏览器插件!
2. Demo 创作思路
灵感来源:自己就是重度 AI 对话用户。跟 DeepSeek 学习了各种知识、跟豆包聊过日常话题——但这些对话散落在各个平台,一周后想找回某个细节只能凭印象翻历史记录,经常翻不到。某天意识到:这些对话本身就是一份高质量的个人知识库,只是没人帮我存下来。
想解决的问题:
- AI 平台的对话不跨平台同步,换平台就丢
- 平台没有历史记录搜索功能(比如复旦智汇岛),或者自带的历史记录搜索是关键词匹配,语义检索做不到
- 已有的对话无法被其他 Agent 工具复用(你想让 openclaw 知道你昨天跟 DeepSeek 讨论过什么?做不到)
为什么做这个方向:判断上有三个取舍——
一是做「采集」还是做「问答」。采集是地基,没数据谈不上 RAG,所以先把五个平台的采集做扎实,问答层基于本地向量检索即可跑通,不依赖外部服务也能用。
二是「被动解析」还是「主动爬取」。我选择了纯被动路线:DOM 模式只解析用户已经浏览渲染的页面,网络拦截模式也是复用用户自身会话凭证请求自己有权访问的对话历史,不模拟任何用户行为,不访问他人数据。合规边界要清晰,这是个会长期运行在用户浏览器里的东西。
三是「本地优先」还是「云端优先」。默认本地 IndexedDB 零配置可用,远程向量库作为可选增强。学习工作场景下数据隐私敏感,本地优先是对的。
3. Demo 体验地址
由于本项目是 Chrome 扩展(MV3),无法提供在线 URL 访问,安装方式:
- 下载 web-ai-chat-collector.zip 并解压
- Chrome 访问
chrome://extensions/ - 开启「开发者模式」
- 点击「加载已解压的扩展程序」选择解压目录
安装后访问 DeepSeek / 千问 / Kimi 等任一平台正常对话,点击悬浮球查看采集结果。
豆包对话提取演示![]()
设置界面介绍视频![]()
4. TRAE 实践过程
完整实践过程总结为5个主要阶段:
需求拆解,DOM 与网络拦截配器逐平台实现,RAG 链路与SKILL集成,多向量库与多模型厂商接入,代码优化。其中适配器实现与RAG链路,多厂商接入实现顺序有交错,代码优化贯穿始终。
以下是关键节点:
阶段——需求拆解与架构设计
跟 TRAE 对话明确实现方式与架构。
Session ID:
.1048292239354748:835c1aaa3cc4ff044fed47894c17cd6a_6a23c962226d8f344f393ca1.6a23c99f226d8f344f393ca3.6a23c99e86dede100cc1d9d7:Trae CN.T(2026/6/6 15:17:51)
阶段——DOM 与网络拦截配器逐平台实现
Session ID: .1048292239354748:ef08724c2840a7cc9d71eb9f14b934a4_6a23d422226d8f344f393fac.6a23e8fe226d8f344f3942f0.6a23e8fc86dede100cc1d9f8:Trae CN.T(2026/6/6 17:31:42)
Session ID: .1048292239354748:2402c3ccefae9200bc356a3d44ef4af6_6a2952890b7be7c25d760fe0.6a2957540b7be7c25d760fe2.6a29575483d891c516c3411d:Trae CN.T(2026/6/10 20:23:49)
Session ID: 1048292239354748:705f54d5bd9696709856b0cce6820d28_6a4b9b00b3fe561b9824b8e2.6a4ba25bb3fe561b9824b9dc.6a4ba25bb3fe561b9824b9da:TRAE Work CN.0.1.34.no_sid.no_ppe.T(2026/7/6 20:40:59)
阶段——RAG 链路与SKILL集成
我通过问AI了解当前实现,然后不断优化
Session ID: .1048292239354748:de64523796e57606ea336c766b5abbe8_6a252f2d29d8c1105b7a8b83.6a252f4429d8c1105b7a8b85.6a252f4370f13746d3515469:Trae CN.T(2026/6/7 16:43:48)
关于SKILL, 我开始尝试了自己部署MCP,后来改成了更为简洁的SKILL。
TRAE的清理代码让人很放心
:
Session ID:
1048292239354748:910f49398146dbe1494e58f30997f880_6a51bd5addbba2dd630f54ee.6a51c30cddbba2dd630f5613.6a51c30cddbba2dd630f5611:TRAE Work CN.0.1.34.no_sid.no_ppe.T(2026/7/11 12:14:04)
阶段——多向量库与多模型厂商接入
向量库抽象层支持 6 种后端(IndexedDB/Chroma/Milvus/pgvector/Supabase/Qdrant),LLM 接入 6 家预设厂商(DashScope/DeepSeek/智谱/Kimi/豆包/MiniMax)均走 OpenAI 兼容协议,思考参数各家格式不同(enable_thinking / thinking:{type} / MiniMax 的 adaptive+reasoning_split),TRAE 帮我统一抽象到 models.json 配置中。
这部分的任务还是非常繁重的,embedding和LLM,以及各种向量库,我每个都试了一遍。
测试Qdrant
Session ID:
1048292239354748:e25295c56027b26bebbabea48aea6c8a_6a510de8ddbba2dd630f5018.6a510de8ddbba2dd630f501b.6a510de8ddbba2dd630f5019:TRAE Work CN.0.1.34.no_sid.no_ppe.T(2026/7/10 23:21:12)
TRAE帮我创建models.json
Session ID:
.1048292239354748:5a9c283fc77c3e846f1acd7d9fff7010_6a51f355827e9d304d7cc85b.6a51f3eb827e9d304d7cc85d.6a51f3ea8906b848abffeee5:Trae CN.T(2026/7/11 15:42:35)
重构LLM分类的结构
阶段——代码优化
举三个例子吧
-
turndown.js 集成与格式还原
发现 DOM 提取出来是纯文本丢失格式,TRAE 推荐用 turndown.js(HTML→Markdown)+ turndown-plugin-gfm(表格/删除线/任务列表)。
1048292239354748:9c4c2bb9bcf4d8dde4fe6744bd198aca_6a530794ac00dffeef9aa0d4.6a530794ac00dffeef9aa0d7.6a530794ac00dffeef9aa0d5:TRAE Work CN.0.1.34.no_sid.no_ppe.T(2026/7/12 11:18:44)
Session ID: .1048292239354748:76cb20fd9c974522abbe944c35d6c40a_6a4cbc2a5b21c260f678897e.6a51e6a3827e9d304d7cc7a2.6a51e6a08906b848abffeedc:Trae CN.T(2026/7/11 14:45:55)
Session ID:
.1048292239354748:63421ecb3005e6564b86e4bffe00c2d5_6a23e993226d8f344f394303.6a23ea7c226d8f344f39432e.6a23ea7b86dede100cc1d9fc:Trae CN.T(2026/6/6 17:38:04)
其它关键任务对话 Session ID:
Session ID:1048292239354748:5897a34a1b24c6e248b3b26f4198cdc1_6a4d14700da939a9972ee558.6a4d1eff0da939a9972ee6bf.6a4d1eff0da939a9972ee6bd:TRAE Work CN.0.1.34.no_sid.no_ppe.T(2026/7/7 23:45:03) —— 添加向量库连通性测试
Session ID:.1048292239354748:8edce450bf7c21b08c4ddfcb8197a316_6a23d422226d8f344f393fac.6a23e7d1226d8f344f3942cd.6a23e7cf86dede100cc1d9f6:Trae CN.T(2026/6/6 17:26:41) —— deepseek对话提取修改bug
Session ID:.1048292239354748:5354e79807769c466abe6c135dda0236_6a531275262c483eb12a71c2.6a532a3d262c483eb12a7465.6a532a3b5416f864050f3436:Trae CN.T(2026/7/12 13:46:37) —— 修复DOM模式下流式对话重复保存的bug
5. 报名审核通过的帖子链接
【学习工作赛道】 ai-chat-collector —— 你的AI对话知识管家(一款 Chrome 浏览器扩展) - TRAE AI 创造力大赛 / 【大赛报名专区】 - TRAE 官方中文社区
技术栈:Chrome MV3 / IndexedDB / DashScope Embedding / turndown.js + GFM / KaTeX / 6 种向量库后端 / 6 家 LLM 厂商 / SKILL 集成
项目仓库: https://github.com/shShwsq/web-ai-chat-collector
开源(MIT),含中英文 README、部署指南、SKILL 集成文档
















