写在前面:
换模型、接API,简单粗暴。这种最朴实无华的方式比什么奇淫技巧都要好。但这不是今天想聊的,省 token 跟存钱一样,不是所有人都能一夜暴富,但每天攒一点,时间长了也能富有。这些方法帮并不一定科学,但是希望可以当作一个参考,养成习惯了,长期积累下来,差距就很可观了。
实测数据说话,不讲玄学,不讲听说。
四个反常识的发现
① 新开对话不一定省 token
如果每一步都让 AI 重新读文件,新对话反而更贵。省钱的做法是:减少读文件的次数,把上一步的输出结果搬运过去。
② 压缩上下文不一定省积分
压缩本身也是要消耗积分的。压缩是长对话专用的工具,不是无脑按钮。
③ 便宜的模型并非不好用
多看看评测,同样的简单任务,不同定价的模型跑出来质量都达标,但花费差好几倍。别一上来就上最强模型,先想想这个任务值不值。
④ 开 Skill 不一定更省
没人会真的拿Skill 去处理一个简单任务,Skill 的价值在于帮你理清复杂需求,所以要按任务复杂度来决定开不开,而不是无脑跳过或无脑开。
为什么 Token 会烧得这么快
每次在同一个对话里发新问题,TRAE 都会把之前所有聊天记录重新打包发给模型。对话越长,每轮输入越大——你越聊,它越贵。
我用模拟了一下:20 轮长对话累计输入约 153,000 token,拆成 4 个短对话只要约 48,000 token,差了 68%。
8 个方法,逐个实测
| 主题 | 方法 | 节省 | 结论 |
|---|---|---|---|
| 1. 提示词结构 | 一段式 vs 多段式 | 42.4% | 多段式更省/更准 |
| 2. 引用方式 | 整文件 vs 单函数 | 30.4% | 单函数更省,更聚焦 |
| 3. 会话管理 | 长会话 vs 新对话 | 35.1% | 新对话更省,但只搬运结论不重读 |
| 4. Skill 值不值 | 用Skill vs 不用 | -360% | 简单任务不开 Skill 更省 |
| 5. 模型补贴 | GLM-5.2 vs DeepSeek V4 | 67.7% | 按任务选模型,便宜模型也够用 |
| 6. 规则固化 | 重复输入 vs Rules | 18.3% | Rules 更省,任务越多越明显 |
| 7. 上下文压缩 | 不压缩 vs 先压缩 | -40.9% | 短对话不需要压缩 cha |
| 8. 忽略文件 | 不配 vs 配 ignore | 25.6% | 配 ignore 更省,减少噪音干扰 |
① 把指令写清楚,比什么都省 
怎么用:
不要一股脑把所有要求塞进一句话。分成结构化的段落写比较省。
| 写法 | 积分 | 用时 | 轮数 |
|---|---|---|---|
| 一段式密指令 | 14.33 | 2分58秒 | 3轮返工 |
| 多段式结构化 | 8.25 | 52秒 | 1轮到位 |
本次测试省了约 42%,而且一轮就做对了,不用反复纠正返工。
啥时候用:每次发需求都该这么写,养成习惯,不需要区分场景。
② 引用代码,别整文件丢进去 
怎么用:如果你清楚具体要修改的内容,直接指出位置,或者直接说「文件第 X~Y 行」也可以,别让AI频繁扫 #整个文件。
| 引用方式 | 积分 | 用时 |
|---|---|---|
| #整文件 引用 | 6.15 | 36秒 |
| #单函数 引用 | 4.28 | 32秒 |
本次积分省了约 30%。
啥时候用:每次引用代码都用
#精准定位,整文件引用几乎永远没必要,除非任务本身就需要理解全文件结构。
③ 新开对话,但有个前提 
怎么用:一个任务一个对话,要换任务就果断新开。关键:把上一步 AI 输出的结论复制粘贴到新对话,不要重新读文件。
| 做法 | 总积分 | 总用时 |
|---|---|---|
| 同一个对话连续提问 | 5.69 | 30秒 |
| 搬运上一个对话的结果,新开一个会话 | 3.69 | 34秒 |
本次省了约 35%,第③步 AI 也明显更专注(没被前面无关内容干扰)。
啥时候用:感觉 AI 开始"变笨"、答非所问的时候。
④ Skill 值不值,看任务复杂度 
怎么用:简单任务直接问,复杂任务 Skill 理清需求、发散性问题取决于模型思考强度。
对于自己清楚输入什么、输出什么的任务,Skill 的"理清需求"环节本身没有必要,直接问反而更快更省,直接问只花了 7.61 积分,套流程花了 35 积分。Skills更多的价值是解决未知的、模糊的问题、以及复用原来的知识,省的是你的时间而不是token。
需要注意的,并不是所有简单的提问都会获得快速的回答。有时候一句hello,也能让大模型过度思考到怀疑人生。
啥时候用:能自己搞定的就别开 Skill,直接问。复杂需求要不要开 Skill,先掂量一下成本。如果你感觉这并不是一个复杂问题,而大模型一直在思考,果断打断。
⑤ 按任务选模型,比无脑上贵的更省 
实测数据(同一个简单任务,两个不同档位的模型):
| 模型 | 积分 | 用时 | 输出质量 |
|---|---|---|---|
| GLM-5.2(有补贴,但价格更高档位x0.4) | 3.1 | 6秒 | 合格 |
| DeepSeek V4 Flash 正式版(更便宜档位x0.05) | 1 | 10秒 | 合格,格式反而更完整 |
本次省了约 68%,而且更便宜的模型输出格式反而更好。
反常识:贵的不一定更好。简单任务下便宜模型完全够用。别一上来就选最强模型,先想想这个任务值不值。
啥时候用:简单任务先用性价比最高的模型试试水。预期结果不满意,再上强模型,也别别为了省钱在复杂任务上凑合。
⑥ 把固定偏好写进 Rules,一劳永逸 
怎么用:在 TRAE 设置 → 规则 → 项目规则中,把「中文注释、函数式风格、不用某遗留配置」等固定要求写进去,以后不用每次重复。
实测数据:连续做 5 个新增函数任务。
| 做法 | 总积分 | 总用时 |
|---|---|---|
| 每次手动带上约束 | 17.5 | 86秒 |
| 配 Rules,输入简洁 | 14.3 | 76秒 |
本次省了约 18%,而且越到后面差距越明显
啥时候用:有固定偏好的开发场景,规则越稳定、任务越多,越划算。一次性小任务不用特意配。
⑦ 上下文压缩,别乱用 
怎么用:对话太长(几十轮)、AI 开始变笨了,点 TRAE 的上下文压缩按钮,把历史浓缩成摘要。
实测数据:4 步积累 + 第 5 步输出报告。
| 做法 | 第5步积分 | 用时 |
|---|---|---|
| 不压缩,直接问 | 2.2 | 38秒 |
| 先压缩,再问 | 3.1 | 41秒 |
压缩反而贵了约 40%,因为压缩本身也要花一次积分,而这个对话本身还不够长,压缩的"回本"空间不够。而且压缩的时间有时候比任务本身思考的时间还要长。
反常识:不要无节制的去压缩。压缩是"先投资后省钱"——对话越长,压缩的回报率越高。
啥时候用:AI 开始答非所问的时候再用,越往后用压缩回报越高。
⑧ 配忽略文件,堵住上下文噪音 
怎么用:在项目根目录的 .gitignore 或 TRAE 的忽略文件设置中,把 compiled/、vendor/、logs/ 等大而无用的文件排除。
| 做法 | 积分 | 用时 |
|---|---|---|
| 不配 ignore | 12.21 | 38秒 |
| 配 ignore | 9.09 | 34秒 |
本次省了约 26%,而且 AI 的分析更聚焦,不会读到噪音文件里的无关代码。
啥时候用:项目里有构建产物、第三方依赖、日志文件的项目,尤其是用
#Workspace全局搜索的时候,这条基本是刚需。
我是怎么测的
先写好技能,让AI一步一步指导我完成测试。
- 一次只改一个变量:同模型、同任务、同环境,只换「要验证的那一招」
- 用量面板记前后:实验前记余额 → 跑任务 → 实验后记余额,消耗 = 前 − 后
- 省了没省坏才算技巧:每个方法我都确认了结果质量没下降
- 样本量提醒:本文大部分对比是单次跑分,存在随机波动,方向性结论可信,具体数字建议自己复现验证
主要使用的是GLM5.2模型,消耗积分大约在200左右
一键结论表
| 方法 | 本次实测节省 | 结论 |
|---|---|---|
| ① 提示词分段写 | ~42% | 一轮到位,少返工 |
| ② #单函数 精准引用 | ~30%(输入token省86%) | 更聚焦,但积分收益不完全等比 |
| ③ 新开对话,只搬运结论 | ~35% | 重读源文件反而更贵,需自行验证 |
| ④ 简单任务不开 Skill | ~-360% | 复杂任务的收益待补测 |
| ⑤ 按任务选模型 | ~68% | 便宜的不一定不好用 |
| ⑥ 写进 Rules | ~18% | 任务越多越划算 |
| ⑦ 上下文压缩 | -40%(短对话反而更贵) | 短对话别压缩 |
| ⑧ 配忽略文件 | ~26% | 减少噪音干扰 |
省 token 没有银弹,每个方法都有它的适用场景和局限。把方向性技巧组合起来用,比迷信某个具体数字更靠谱。











