#TRAE 技巧便利店 | 用数据说话:198 条 TRAE 会话记录里挖出的 10 个省积分真相

#TRAE 技巧便利店 | 用数据说话:198 条 TRAE 会话记录里挖出的 10 个省积分真相

作者:一个重度 TRAE Work 用户(2026.07–08,59 个会话,198 条记录)
这篇不是"我觉得好用"的经验帖,而是把过去一个月的 TRAE 会话记忆(59 个会话、198 条意图记录)翻出来做了量化统计后,得出的 10 个"用数据验证过"的省积分结论。每条都附实验口径与真实案例。


先说实验方法(可复现)

  • 数据源:TRAE 记忆导出(JSONL 格式,每条含 intent/actions/outcome/learned 四字段),共 59 个会话、198 条记录(2026.07 有 164 条,2026.08 有 34 条)。
  • 方法:按行为关键词对 198 条记录分类统计频率;提取"返工/修复类"与"一次定型类"记录做对照;单独挖出所有成本数字(免费额度、单价、用量)。
  • 局限:记忆是会话摘要,不是逐字对话,数字为近似统计,但足以反映行为占比的强弱关系。

行为频率总榜(实验 A,198 条记录中各类行为提及次数):

排名 省分行为 提及记录数 占比
1 测试 / CI 回归 78 39%
2 方案对比(先想后做) 39 20%
3 数据驱动迭代 37 19%
4 工具复用 / 缓存优化 32 16%
5 提示词资产化 27 14%
6 自动化 / 定时任务 25 13%
7 小步推进 / 优先级拆分 19 10%
8 代码审查(自查纠错) 16 8%
9 交互减负 7 4%
10 免费模型 / 额度 3(提及型) 2%

下面按"效果从大到小"逐个拆解。


技巧 1:先方案对比、再动手写代码 —— 一次定型 vs 反复返工,数据差 3 倍

实验 B 结论:198 条记录里,"返工/修复类"有 27 条,“一次定型类"只有 9 条——也就是说,即便是我这个老用户,也仍有 3 倍于"顺利"的"返工"时刻。而这些返工里,相当一部分源于"没想清楚就开写”。

对照案例(同一时间段的两个项目):

  • 普拉提体态追踪 MVP(先方案后写):先让 Work 对比 3 个技术方案(原生小程序 / 一套代码双端 / 前后端 TS 统一),最终选"模块化单体 + 原生小程序",一次定型,后续 14 周里程碑全部按此架构推进,没有换栈返工。
  • 黑客松邮件推送(边写边修):期间经历了 CI 失败诊断、GLM 400 错误、12 项问题修复、46 个测试补充、9 个未提交 bug 补交……修复记录远多于设计记录。

省分原理:方案讨论只花 1 次上下文;错误技术栈的返工要烧 N 次上下文。数据上,N≥3。


技巧 2:把"测试"变成零成本 —— CI 用 replay 模式回归(榜首行为)

实验 A 结论:"测试 / CI 回归"是出现频率最高的行为,198 条里 78 条提到,占 39%。它既是最大的开销点,也是最大的省分点。

实证数字:

  • CI 设 LLM_GATEWAY_MODE=replay,用录制回放(cassette)做回归,零成本;我的项目里 28 条 cassette 入库,后续每次 CI 回归都不消耗真实 API 调用。
  • 最终"省力 Agent"项目:LLM 模式通过五处修复,把评测平均分提到 1.95、0 分率降到 0%,而验证成本几乎为零。
  • 配套用"确定性退出码"验证,CI 信号本地直跑,不碰模型。

省分原理:真实调用只发生在必要的验收环节,其余全部廉价回放。这是单条省分量最大的一招。


技巧 3:数据驱动迭代,而不是蛮力重试

实验 A 结论:"数据驱动迭代"排名第 3(37 条,19%),是我省分效果最显著的行为之一。

实证案例:AI 图片评分系统跑了几十轮——13 个主题、65 张图、5 维评分,全部落库后分析出:

  • "废墟美学"是跨主题最稳定的高分策略(11 个主题均值 9.0);
  • "文字渲染"是死亡组合(相关性 -0.40);
  • 高分图 85% 使用了体积光。

有了这些规律,后续每轮生成的成功率大幅提升。同样的积分,一次用出十次的经验;而不是十次重复同样的失败。


技巧 4:提示词资产化 —— 27 条记录在反复验证"一个提示词复现项目"

实验 A 结论:"提示词资产化/复用"27 条(14%),包括 spec、重建提示词、prompt 复用等。

实证案例:词源学习应用(etymology-app),让 Work 分析项目优点后产出"重建提示词",第二个 agent 仅靠它从零开发,直接对齐原项目功能。还有一次让一个 agent"只依靠一个提示词"完成整个项目开发。

省分原理:一次沉淀、永久复用——同样的上下文成本,被摊薄到每次使用上。


技巧 5:工具一次做好、处处复用(缓存/索引/极简依赖)

实验 A 结论:"工具复用/缓存优化"32 条(16%)。

实证案例:

  • 词源应用用模块级缓存把 613+5011 次文件读取合并成 1 次、用 Map 索引把查找从 O(n) 降到 O(1)、用倒排索引做高效查询——性能优化的同时,每次读取省掉的都是上下文/token;
  • 代码只保留极简依赖(仅 6 个运行时依赖),构建、加载、CI 都快;
  • 评分工具 HTML 跨主题通用,换主题不用重建页面。

省分原理:把"每次都要付的钱"变成"一次性的投资"。


技巧 6:能自动就自动 —— 定时任务一次配置、长期白嫖

实证案例:每日黑客松信息推送工具——每天自动爬取全网线上黑客松、LLM 筛选去重(标题归一化+SHA256)、渲染邮件、定时发出,全程 GitHub Actions Cron 托管,一个月几乎零人工、零成本

省分原理:这是"省积分"的极致——连"用"都省了,因为它在替你自动工作。注意 GitHub Actions Cron 实际触发可能延迟 5–30 分钟,排期留余量。


技巧 7:小步推进、P0-P3 优先级拆分,减少"一锅端"失败

实验 A 结论:"小步推进/优先级拆分"19 条(10%)。

实证案例:红山"省力 Agent"项目按 P0→P1→P2→P3 推进(数据层补全、Persona Prompt 修复、CI 门禁落地、素材升华),每步有验收点,一次通过率极高。反例:一次性让 AI 做 10 件事,它容易漏、容易错,检查纠偏反而更烧积分。

省分原理:小步推进时上下文精确,AI 不在无关代码上浪费 token;出错时精准定位,而不是整段重来。


技巧 8:让 Work 审查自己 —— 16 条记录证明 code review 是省分不是费分

实验 A 结论:"代码审查"16 条(8%)。

实证案例:一次 receiving-code-review 审查抓出 9 个未提交的 bug、死代码、未使用依赖、CI 缓存键设置不当;另一次修复了"邮件链接不带 https:// 导致无法点击"的隐藏 bug(补 9 个场景测试)。这些问题上线后被发现,修复成本高好几倍。

省分原理:防患于未然,比亡羊补牢便宜得多。


技巧 9:免费额度挖到源头(实验 C 实测数字)

把记忆里所有成本数字翻出来,这几条是"实测过"的:

资源 实测成本 出处
glm-4-flash 永久免费(glm-4-search 已失效) 2026-07-26 记录
search_std 搜索 ¥0.01/次 同上
GitHub Actions 公开仓库 每月 2000 分钟免费 同上
Resend 免费域名 免费,但有发送限制 2026-07-25 记录
CI replay 回归 零成本(28 条 cassette) 2026-07-18 记录

实测案例:黑客松推送项目一开始用按次计费的搜索模型,换 glm-4-flash 后 LLM 联网搜索成本直接归零;整个推送服务白嫖 GitHub Actions 免费额度。

省分原理:能免费的先免费,把付费额度留给真正不可替代的部分。


技巧 10:交互减负 —— 少一次点击,少一轮对话(被低估的行为)

实验 A 结论:"交互减负"只有 7 条(4%),占比最小,但边际收益极高。

实证案例:评分工具 v6 每张图只按一个键完成打分、全屏沉浸、自动跳转下一张;图片直接嵌入工具,省掉导入步骤;压缩到 900px 宽 quality 72。

省分原理:人机交互每少一步,AI 需要理解的上下文就越少,误操作引发的重试也越少。7 次"顺手优化",换来的是几十轮省下的对话。


最后:数据告诉我的三句话

  1. 测试与 CI 是最大开销,也是最大省分点(39% 提及率)——replay 回归是性价比之王;
  2. 先方案后写代码,把返工率(3:1)反过来(27 条返工 vs 9 条定型,根源多在没想清楚);
  3. 省分不是"少用",而是"每次都用出复利"——提示词资产化、工具复用、数据驱动,都是把一次性成本摊薄成长期收益。

祝大家都能把积分花出双倍效果!如果你也有数据支撑的省分技巧,欢迎交流 :bar_chart:


统计口径:基于 TRAE 会话记忆导出(JSONL),59 会话/198 记录,行为按关键词分类,数字为近似统计。