[学习工作赛道]Cone-你的企业数据智能大脑

1.Demo 简介

是什么:Cone 是一个面向企业的异构数据智能检索系统(Web 网站 + 后端服务)。它把企业里散落的 Excel、Word、PDF、CSV、TXT、Markdown 统一收纳进一个"知识图书馆",用户用一句中文自然语言就能查到任何数据,系统自动决定走 LLM Wiki 直接回答、还是生成 SQL 交给 DuckDB 执行、还是走向量检索,全程零门槛、零幻觉、可溯源

面向谁:任何不会写 SQL / 不会用 BI 工具的企业员工——HR 查人员分布、销售对区域业绩、运营查供应商合作年限、新员工查员工手册。核心场景是企业内部"找数据难、算数据更难、留痕追溯最难"的三难痛点。

主要功能

2. Demo 创作思路

  • 灵感来源:在真实企业里观察到一个普遍现象——数据明明就存在 Excel 里,但"找一个数字"的成本高得离谱:要么求会 SQL 的同事帮忙拉数,要么自己在几十个 Sheet 间肉眼搜索,要么靠记忆拍脑袋。而市面上的 BI 工具门槛高、通用 ChatGPT 又算不准数(LLM 算术幻觉是人尽皆知的顽疾)。我意识到这是一个"工具错配"的真空地带:用户要的不是更强的 BI,而是能听懂中文、算得准、还留得了痕的"企业数据图书馆"

    想解决的问题

    • 找数据慢:不会 SQL 的员工查一个数字要等几小时甚至几天。Cone 让他们用一句话秒级拿到结果。

    • AI 算不准数:通用大模型直接算"华东比华北高多少"经常出错。Cone 的架构红线是**“计算完全下沉”**——LLM 只做翻译和推理,所有加减乘除交给 DuckDB 列式数据库执行,从根上消除算术幻觉。

    • 知识沉淀难:Excel/Word/PDF 散落各处,新员工找不到员工手册、销售找不到历史报价单。Cone 统一入库、智能摘要、可检索可追溯。

    • 审计追溯难:谁改了哪个单元格?谁查过敏感数据?传统日志可被篡改。Cone 用区块链式哈希链存证,不可篡改、可一键校验。

    为什么做这个方向:有三个判断让我坚定这个取舍——

    1. LLM 擅长语义理解、不擅长算术:与其硬逼 LLM 算对数字(注定会幻觉),不如让 LLM 做"翻译官"(中文→SQL),把计算交给确定性引擎。这是架构层面的根本性差异。

    2. 企业数据是结构化为主、非结构化为辅:纯 RAG 方案只能做文档问答,碰见"求和、比较、趋势"就无能为力。Cone 把 SQL 执行作为一等公民,RAG 作为兜底,双轨并行才能覆盖企业真实场景。

    3. 企业级 ≠ 个人玩具:单机 demo 容易,但企业需要多租户隔离、权限分级、审计存证、灾备恢复。这些"重活"才是产品能落地的护城河,所以 Cone 从第一天就把审计链、企业隔离、灾备写进了核心架构。
      技术实现要点

      核心架构:LLM Wiki + RAG 双路径

      系统默认 engine_mode='auto',根据问题类型自动路由到最优路径:

      • Wiki 主路径(约 85% 查询):将全量数据序列化为 Markdown 表格注入 LLM 上下文(容量上限 20000 行),让 LLM 直接"看全表回答",绕过 SQL 生成与向量检索。配套三层防幻觉机制:

        • 预计算 SUM 锚点:导入时对每张表数值列预计算总和,注入 prompt 让 LLM"只读不算",避免大数加法出错

        • 大表统计自动生成:单表超过 500 行时自动生成 COUNT/AVG/MAX/MIN 统计摘要,确保 LLM 能访问到准确聚合数据

        • 答案后验 SQL 重校验:LLM 回答后,对 AVG/SUM/MAX/MIN 类问题用 SQL 执行相同计算做交叉验证,不一致则触发重答

      • RAG 路径(约 15% 查询,计算类专用):对"X 比 Y 高多少"“环比增长”"占比是多少"等计算类问题,优先走 Text-to-SQL + DuckDB 执行,Wiki 作为失败兜底。包含报错自愈(Binder Error 时 LLM 修正 SQL 重试)

      • 多层零 LLM Pre-Intent 快速路径:对高频确定性查询(字段存在性、供应商合作年份、占比比例、地区+业绩+实体、单实体点查)在意图分类前用正则直接走 SQL,零 LLM 调用、毫秒级响应,省下 5-8 秒延迟

      • 向量检索兜底:默认 TF-IDF(零外部依赖),可配置切换至 BGE + BM25 + RRF + Cross-Encoder 混合检索,单机即可跑

      数据安全三件套

      • 审计链:按企业隔离分链 + Merkle Tree 哈希归约 + 创世区块 + 逐块 prev_hash 链式结构,支持一键完整性校验

      • 灾备:企业级快照 + SHA-256 哈希清单 + 一键恢复,关键操作全部写入审计链

      • SQL 注入纵深防御:注释剥离(防 DRO/**/P 绕过)+ 危险词黑名单 + 前缀白名单(仅允许 SELECT/WITH)+ 分号堆叠检测

      技术栈:FastAPI + DuckDB(列式分析库)+ GLM-4-flash(LLM)+ 原生 HTML/CSS/JS 前端(零依赖)+ PyJWT 认证 + httpx + Loguru + Dockerfile 容器化部署。设计语言采用"新闻纸"风格(油墨黑 + 米白底 + 微软雅黑),呼应"图书馆"的隐喻。

3. Demo 体验地址(三选一)

4. TRAE 实践过程

    • 逻辑改动验证和压力测试488115048929353:5725a76782779b4e4ae76e46d23a3f0a_6a4318c6c4c2b3b5e3981804.6a432274c4c2b3b5e39819fe.6a432274c4c2b3b5e39819fc:TRAE Work CN.0.1.23.no_sid.no_ppe.T(2026/6/30 09:57:08)

    1488115048929353:3856c05592ba44b097220934e06bfbb8_6a4318c6c4c2b3b5e3981804.6a432c5cc4c2b3b5e3981b42.6a432c5cc4c2b3b5e3981b40:TRAE Work CN.0.1.23.no_sid.no_ppe.T(2026/6/30 10:39:24)

    1488115048929353:39afe68c539d3b9df9e0f5f111bd4129_6a4318c6c4c2b3b5e3981804.6a433161c4c2b3b5e3981b80.6a433161c4c2b3b5e3981b7e:TRAE Work CN.0.1.23.no_sid.no_ppe.T(2026/6/30 11:00:49)

    • 代码分块便于维护和项目审计1488115048929353:ba0532c37b5f57884560d7a797ceb14d_6a435fc1c4c2b3b5e3981e04.6a43674ac4c2b3b5e3981fd4.6a43674ac4c2b3b5e3981fd2:TRAE Work CN.0.1.23.no_sid.no_ppe.T(2026/6/30 14:50:50)

    1488115048929353:617caf86d32eddd6919b840a224bf6f1_6a435fc1c4c2b3b5e3981e04.6a437945c4c2b3b5e3982446.6a437945c4c2b3b5e3982444:TRAE Work CN.0.1.23.no_sid.no_ppe.T(2026/6/30 16:07:33)
    架构
    1488115048929353:b530e30d5f534c4a576555d9c5dfd664_6a33f407d30ccd787fbed0bc.6a33f407d30ccd787fbed0bf.6a33f407d30ccd787fbed0bd:TRAE Work CN.0.1.23.no_sid.no_ppe.T(2026/6/18 21:35:03)|
    概览
    1488115048929353:9aa483255d59985088307c737d6da101_6a33f407d30ccd787fbed0bc.6a395e2cb12abbfe7ea50d8b.6a395e2cb12abbfe7ea50d89:TRAE Work CN.0.1.23.no_sid.no_ppe.T(2026/6/23 00:09:16)
    ui
    1488115048929353:07edbc25fd5316ec76c22239813329ed_6a3a841fe592291f46bb3d34.6a3aa41de592291f46bb42f5.6a3aa41de592291f46bb42f3:TRAE Work CN.0.1.23.no_sid.no_ppe.T(2026/6/23 23:19:57)
    架构总结
    1488115048929353:b0d1dd4abd874100c765b4485ff14804_6a4514128aba7be97e2fe0c7.6a4514138aba7be97e2fe0ca.6a4514128aba7be97e2fe0c8:TRAE Work CN.0.1.23.no_sid.no_ppe.T(2026/7/1 21:20:19)

    依旧是项目审计
    1488115048929353:99d2e570564ea203027f1ecf9585a55f_6a437e84c4c2b3b5e398270f.6a437e84c4c2b3b5e3982712.6a437e84c4c2b3b5e3982710:TRAE Work CN.0.1.23.no_sid.no_ppe.T(2026/6/30 16:29:56)
    架构转向
    1488115048929353:a4ee623d8f83bda9ea32fa901d4a7701_6a4f58fdbb21ec4be810b6f4.6a5483936a2a9149eb034dff.6a5483936a2a9149eb034dfd:TRAE Work CN.0.1.32.no_sid.no_ppe.T(2026/7/13 14:20:03)
    关键优化
    1488115048929353:076d35b9832ff52dfcf56506973f3fc1_6a4f58fdbb21ec4be810b6f4.6a54a1c86a2a9149eb03543e.6a54a1c86a2a9149eb03543c:TRAE Work CN.0.1.32.no_sid.no_ppe.T(2026/7/13 16:28:56)

    代码分模块

    技术规范


    溯源透明


    架构转向


  • 关键优化

5. 对应的报名审核通过的帖子链接

[学习工作赛道]Cone-企业数据智能大脑 - TRAE AI 创造力大赛 / 【大赛报名专区】 - TRAE 官方中文社区

我看完这个项目后,比较喜欢你们把 LLM 定位成“翻译官”,再把真实计算交给 DuckDB 执行的设计,因为它正好解决了企业场景里最怕的 AI 幻觉问题:业务人员可以用自然语言提问,但结果仍然有数据来源和可校验路径。

小建议:可以在帖子开头补一个最短演示路径,比如“上传一份 Excel → 提问销售总额 → 展示 SQL/来源引用 → 查看审计链”,这样评委能更快看懂它和普通企业知识库或聊天机器人的差异。

我们也在生活娱乐赛道做了《衍境》,偏互动影游创作系统,欢迎来互评:【生活娱乐赛道】衍境 Demo:EvoMap 驱动的互动影游智能体创作系统

我看完这个项目后,比较喜欢你们把 LLM 定位成“翻译官”,再把真实计算交给 DuckDB 执行的设计,因为它正好解决了企业场景里最怕的 AI 幻觉问题:业务人员可以用自然语言提问,但结果仍然有数据来源和可校验路径。
小建议:可以在帖子开头补一个最短演示路径,比如“上传一份 Excel → 提问销售总额 → 展示 SQL/来源引用 → 查看审计链”,这样评委能更快看懂它和普通企业知识库或聊天机器人的差异。
我们也在生活娱乐赛道做了《衍境》,偏互动影游创作系统,欢迎来互评:【生活娱乐赛道】衍境 Demo:EvoMap 驱动的互动影游智能体创作系统

设计很好看,是使用了 claude 风格吗,用了 trae design吗

没有,是找的素材网站然后进行的微调