#TRAE 技巧便利店 | 用数据说话:198 条 TRAE 会话记录里挖出的 10 个省积分真相
作者:一个重度 TRAE Work 用户(2026.07–08,59 个会话,198 条记录)
这篇不是"我觉得好用"的经验帖,而是把过去一个月的 TRAE 会话记忆(59 个会话、198 条意图记录)翻出来做了量化统计后,得出的 10 个"用数据验证过"的省积分结论。每条都附实验口径与真实案例。
先说实验方法(可复现)
- 数据源:TRAE 记忆导出(JSONL 格式,每条含 intent/actions/outcome/learned 四字段),共 59 个会话、198 条记录(2026.07 有 164 条,2026.08 有 34 条)。
- 方法:按行为关键词对 198 条记录分类统计频率;提取"返工/修复类"与"一次定型类"记录做对照;单独挖出所有成本数字(免费额度、单价、用量)。
- 局限:记忆是会话摘要,不是逐字对话,数字为近似统计,但足以反映行为占比的强弱关系。
行为频率总榜(实验 A,198 条记录中各类行为提及次数):
| 排名 | 省分行为 | 提及记录数 | 占比 |
|---|---|---|---|
| 1 | 测试 / CI 回归 | 78 | 39% |
| 2 | 方案对比(先想后做) | 39 | 20% |
| 3 | 数据驱动迭代 | 37 | 19% |
| 4 | 工具复用 / 缓存优化 | 32 | 16% |
| 5 | 提示词资产化 | 27 | 14% |
| 6 | 自动化 / 定时任务 | 25 | 13% |
| 7 | 小步推进 / 优先级拆分 | 19 | 10% |
| 8 | 代码审查(自查纠错) | 16 | 8% |
| 9 | 交互减负 | 7 | 4% |
| 10 | 免费模型 / 额度 | 3(提及型) | 2% |
下面按"效果从大到小"逐个拆解。
技巧 1:先方案对比、再动手写代码 —— 一次定型 vs 反复返工,数据差 3 倍
实验 B 结论:198 条记录里,"返工/修复类"有 27 条,“一次定型类"只有 9 条——也就是说,即便是我这个老用户,也仍有 3 倍于"顺利"的"返工"时刻。而这些返工里,相当一部分源于"没想清楚就开写”。
对照案例(同一时间段的两个项目):
- 普拉提体态追踪 MVP(先方案后写):先让 Work 对比 3 个技术方案(原生小程序 / 一套代码双端 / 前后端 TS 统一),最终选"模块化单体 + 原生小程序",一次定型,后续 14 周里程碑全部按此架构推进,没有换栈返工。
- 黑客松邮件推送(边写边修):期间经历了 CI 失败诊断、GLM 400 错误、12 项问题修复、46 个测试补充、9 个未提交 bug 补交……修复记录远多于设计记录。
省分原理:方案讨论只花 1 次上下文;错误技术栈的返工要烧 N 次上下文。数据上,N≥3。
技巧 2:把"测试"变成零成本 —— CI 用 replay 模式回归(榜首行为)
实验 A 结论:"测试 / CI 回归"是出现频率最高的行为,198 条里 78 条提到,占 39%。它既是最大的开销点,也是最大的省分点。
实证数字:
- CI 设
LLM_GATEWAY_MODE=replay,用录制回放(cassette)做回归,零成本;我的项目里 28 条 cassette 入库,后续每次 CI 回归都不消耗真实 API 调用。 - 最终"省力 Agent"项目:LLM 模式通过五处修复,把评测平均分提到 1.95、0 分率降到 0%,而验证成本几乎为零。
- 配套用"确定性退出码"验证,CI 信号本地直跑,不碰模型。
省分原理:真实调用只发生在必要的验收环节,其余全部廉价回放。这是单条省分量最大的一招。
技巧 3:数据驱动迭代,而不是蛮力重试
实验 A 结论:"数据驱动迭代"排名第 3(37 条,19%),是我省分效果最显著的行为之一。
实证案例:AI 图片评分系统跑了几十轮——13 个主题、65 张图、5 维评分,全部落库后分析出:
- "废墟美学"是跨主题最稳定的高分策略(11 个主题均值 9.0);
- "文字渲染"是死亡组合(相关性 -0.40);
- 高分图 85% 使用了体积光。
有了这些规律,后续每轮生成的成功率大幅提升。同样的积分,一次用出十次的经验;而不是十次重复同样的失败。
技巧 4:提示词资产化 —— 27 条记录在反复验证"一个提示词复现项目"
实验 A 结论:"提示词资产化/复用"27 条(14%),包括 spec、重建提示词、prompt 复用等。
实证案例:词源学习应用(etymology-app),让 Work 分析项目优点后产出"重建提示词",第二个 agent 仅靠它从零开发,直接对齐原项目功能。还有一次让一个 agent"只依靠一个提示词"完成整个项目开发。
省分原理:一次沉淀、永久复用——同样的上下文成本,被摊薄到每次使用上。
技巧 5:工具一次做好、处处复用(缓存/索引/极简依赖)
实验 A 结论:"工具复用/缓存优化"32 条(16%)。
实证案例:
- 词源应用用模块级缓存把 613+5011 次文件读取合并成 1 次、用 Map 索引把查找从 O(n) 降到 O(1)、用倒排索引做高效查询——性能优化的同时,每次读取省掉的都是上下文/token;
- 代码只保留极简依赖(仅 6 个运行时依赖),构建、加载、CI 都快;
- 评分工具 HTML 跨主题通用,换主题不用重建页面。
省分原理:把"每次都要付的钱"变成"一次性的投资"。
技巧 6:能自动就自动 —— 定时任务一次配置、长期白嫖
实证案例:每日黑客松信息推送工具——每天自动爬取全网线上黑客松、LLM 筛选去重(标题归一化+SHA256)、渲染邮件、定时发出,全程 GitHub Actions Cron 托管,一个月几乎零人工、零成本。
省分原理:这是"省积分"的极致——连"用"都省了,因为它在替你自动工作。注意 GitHub Actions Cron 实际触发可能延迟 5–30 分钟,排期留余量。
技巧 7:小步推进、P0-P3 优先级拆分,减少"一锅端"失败
实验 A 结论:"小步推进/优先级拆分"19 条(10%)。
实证案例:红山"省力 Agent"项目按 P0→P1→P2→P3 推进(数据层补全、Persona Prompt 修复、CI 门禁落地、素材升华),每步有验收点,一次通过率极高。反例:一次性让 AI 做 10 件事,它容易漏、容易错,检查纠偏反而更烧积分。
省分原理:小步推进时上下文精确,AI 不在无关代码上浪费 token;出错时精准定位,而不是整段重来。
技巧 8:让 Work 审查自己 —— 16 条记录证明 code review 是省分不是费分
实验 A 结论:"代码审查"16 条(8%)。
实证案例:一次 receiving-code-review 审查抓出 9 个未提交的 bug、死代码、未使用依赖、CI 缓存键设置不当;另一次修复了"邮件链接不带 https:// 导致无法点击"的隐藏 bug(补 9 个场景测试)。这些问题上线后被发现,修复成本高好几倍。
省分原理:防患于未然,比亡羊补牢便宜得多。
技巧 9:免费额度挖到源头(实验 C 实测数字)
把记忆里所有成本数字翻出来,这几条是"实测过"的:
| 资源 | 实测成本 | 出处 |
|---|---|---|
| glm-4-flash | 永久免费(glm-4-search 已失效) | 2026-07-26 记录 |
| search_std 搜索 | ¥0.01/次 | 同上 |
| GitHub Actions 公开仓库 | 每月 2000 分钟免费 | 同上 |
| Resend 免费域名 | 免费,但有发送限制 | 2026-07-25 记录 |
| CI replay 回归 | 零成本(28 条 cassette) | 2026-07-18 记录 |
实测案例:黑客松推送项目一开始用按次计费的搜索模型,换 glm-4-flash 后 LLM 联网搜索成本直接归零;整个推送服务白嫖 GitHub Actions 免费额度。
省分原理:能免费的先免费,把付费额度留给真正不可替代的部分。
技巧 10:交互减负 —— 少一次点击,少一轮对话(被低估的行为)
实验 A 结论:"交互减负"只有 7 条(4%),占比最小,但边际收益极高。
实证案例:评分工具 v6 每张图只按一个键完成打分、全屏沉浸、自动跳转下一张;图片直接嵌入工具,省掉导入步骤;压缩到 900px 宽 quality 72。
省分原理:人机交互每少一步,AI 需要理解的上下文就越少,误操作引发的重试也越少。7 次"顺手优化",换来的是几十轮省下的对话。
最后:数据告诉我的三句话
- 测试与 CI 是最大开销,也是最大省分点(39% 提及率)——replay 回归是性价比之王;
- 先方案后写代码,把返工率(3:1)反过来(27 条返工 vs 9 条定型,根源多在没想清楚);
- 省分不是"少用",而是"每次都用出复利"——提示词资产化、工具复用、数据驱动,都是把一次性成本摊薄成长期收益。
祝大家都能把积分花出双倍效果!如果你也有数据支撑的省分技巧,欢迎交流 ![]()
统计口径:基于 TRAE 会话记忆导出(JSONL),59 会话/198 记录,行为按关键词分类,数字为近似统计。