【积分自救】额度焦虑我懂,但之后——我靠这 16 条方法把 Token 消耗砍了 80%

额度焦虑我懂,但之后——我靠这 16 条方法把 Token 消耗砍了 80%


先说句实话

周限额来了,日限额来了,SOLO 给你弹一句"今天先到这里也不错,好好休息下吧~"——

我懂,这些情绪完全合理。

但说完之后呢?

额度该没还是没。排队 3000 人的时候你总不能干等着。

所以我换了个思路:我控制不了他们给多少,但我能控制自己花多少。

下面 15 条,全是我这几个月真金白银(真 自己的积分)试出来的。代码质量没降,产出没少,额度从"三天见底"变成"一周还有富余"。

这些纯粹是你自己能掌控的部分


第一刀:砍掉你根本不需要东西(最容易被忽略)

1. 去插件管理里,把你的 Skill 审一遍

打开你的 Skill 列表,认真问自己:这些我真的在用吗?

我清理之前有 20 多个 Skill,清理之后留了 6 个。那些"装了觉得以后可能用得上"的,大概率你永远不会用。但每一个激活的 Skill 都在吃你的上下文窗口。

关掉他们,你真要用,你可以手动唤醒

不用的,关掉。别犹豫。

2. 飞书、GitHub 集成——你真的需要吗?

说句得罪人的话:接入飞书同步、GitHub 自动 PR——你真的需要吗?还是说,你只是不会手动上传?

我观察了一下自己的使用记录,所谓的"自动化集成"一个月触发不到两次。但它在后台常驻,每次对话都要加载配置描述,默默吃 Token。

手动拖一下文件、手动 push 一下代码,30 秒的事。别为了省 30 秒的操作,每次对话多花 300积分

3. 把所有自动化全关了

TRAE 设置里那些"自动触发"“自动补全建议”“自动上下文扩展”——全关。

你大概率用不到。就算偶尔用到,手动触发一下的成本远低于它 24 小时在后台帮你"智能判断"的成本。

自动化是给企业版几百人团队用的。个人开发者,手动挡就够了。


第二刀:管住 AI 的"手"(这是大头)

4. 别让 AI 开一堆子代理

这条极其重要

我有一次让 SOLO 处理一个中等复杂度的任务,它自己拆了 9 个 Sub Agent 去并行跑。我事后一看 Token 消耗报告——光输入就 53 万 Token,工具调用 111 次。

9 个子代理,每个都要独立加载上下文、独立推理、独立输出。这不是"并行加速",这是9 倍烧钱

对策:

  • 在 Prompt 里明确写:“不要拆分子代理大于3个,尽量单线程完成”(这与我当时的用子代理并行写代码不一样,毕竟计价不同)
  • 如果任务确实复杂,你自己手动拆成 3 个小任务分 3 个会话做,比让它自己拆 9 个 Agent 省得多

5. 让 AI 输出 Diff,不要输出完整文件

在指令末尾加一句:“只修改部分,不要重复未改动的代码。”

一个 500 行的文件改 10 行,完整输出 = 500 行 Token。Diff 输出 = 15 行 Token。差 30 倍。

6. 用 /plan 先审,再动手

中大型任务别直接说"帮我写"。先 /plan,让它列计划。你看完确认了再执行。

为什么?因为一次做对 > 三次返工。我实测"直接写→不满意→改→还不满意→再改"的总 Token 消耗,是先 plan 再写的 2-3 倍

7. 精准引用,别全量粘贴

只引用相关函数,指定单个文件。

永远不要把整个项目、5000 行日志、或者"你帮我看看这个文件夹"丢进去。精准引用 vs 全量粘贴,Token 差 5-10 倍,而且模型改代码更准,不会到处乱动。

7. 学会把调试信息给AI

把调试信息给他,有办法帮他减少排查时间


这是我的对话截图


第三刀:改变你的表达方式(零成本)

8. 砍掉一切废话

:cross_mark: “你好,我想请你帮我看一下这段代码,我觉得它可能有点问题,不知道你能不能帮我优化一下,谢谢”

:white_check_mark: “优化此函数,目标:减少嵌套”

模型不需要"请"“谢谢”“麻烦”。每一个礼貌用语都是真金白银。

9. 结构化 > 长句

:cross_mark: “我需要你写一个函数,这个函数的作用是接收一个用户的ID,然后到数据库里面去查这个用户的订单,然后返回订单的列表,要求用Python写,使用SQLAlchemy。”

:white_check_mark:正确方法:

任务:查询函数
输入:user_id: int
输出:List[Order]
栈:Python + SQLAlchemy
约束:异步,带分页

Token 少 60%,模型理解反而更准。

10. 一条消息说完,别分 5 条发

每多一轮对话,历史上下文就多复制一份。把需求、约束、示例合并成一条结构化消息。

11. 被截断了?说"继续",别说"重新写"

“continue”= 接着输出剩余部分。
“重新写”= 把前面几千 Token 的输出再读一遍再重写。


第四刀:借助外力(聪明地省)

12. 装一个 Ponytail

GitHub 上 8 万 Star 的那个"马尾辫"。核心逻辑就一句话:教 AI 做减法。

它不是压缩文本,而是让 AI 在动手之前先自我审查:这个功能真的需要吗?能不能用标准库?能不能少写几行?

实测数据:Token 消耗降 22%,代码量砍 54%,速度反而快 27%。安全性不打折。

三档强度可选:lite / full / ultra。我日常用 full,极端赶工用 ultra。

上面的是文件下载地址

13. 文件整理、格式转换、文档归纳——扔给豆包或千问

TRAE 是写代码的。

你要整理一个 Excel、重命名 200 个文件、把一份 PDF 转成 Markdown、归纳一份会议纪要——这些事情打开豆包或者通义千问,免费,不限量,效果一样好。

别拿 TRAE 的 Token 去干这些活。就像你别拿依云矿泉水涮拖把。

14. 按任务选模型

任务 用什么 省多少
补全、翻译、格式化 轻量模型 省 70%+
日常写码、改 Bug 主力模型 基准
架构设计、复杂重构 顶配 不省,但值得

简单任务用顶配,能力差距 < 5%,价格差距 10-20 倍。

15. 一个任务一个会话,做完就关

大模型是无状态的,每轮对话都把历史全部重传。聊 30 轮之后你的上下文可能已经 大量 Token,其中 90% 是噪音。

需要延续?手动写 3-5 句摘要带过去。比拖着 30 轮历史高效 10 倍。

当然你也可以手动压缩上下文(做好模型失忆的准备)

16.参考官方的帖子的做法

理解 Token 和上下文窗口


最后说两句

省 Token 的终极目标不是"抠门",是让模型的注意力集中在真正重要的信息上。上下文越干净,模型越聪明,代码质量反而越高。

这不是妥协,这是工程能力。

共勉。

3 个赞

开源社区在成本优化上有成熟方案。而且聚焦到个人开发者层面,积分制带来的成本消耗仍是不可忽视的硬性成本。既然优化尚在“未实现”阶段,为何不直接采用已落地的工具?或许显得短视,但在现实成本面前,这是最直接有效的选择——正如 esengine/DeepSeek-Reasonix,作为专为DeepSeek设计的终端AI编程助手,其围绕前缀缓存稳定性进行工程优化,支持长期后台运行,能切实降低重复请求的接口开销。

1 个赞

没有必要,又不是只有他trae一家,积分消耗的快就换一个。

没办法,用出感情了:sob:,而且切换的话,我还要重新写qoder的工作流适配。我以前写过TRAE的工作流适配,但是如果要这么做的话你要分析他的内部的AI调用逻辑和功能之类的内容,虽然做做适配只要半个小时左右,但还要考虑内置的技术债,可以但是麻烦

还真是。subagent还有一个大问题,就是在略长一点的任务中,一旦触发自动压缩,subagent的相关信息在压缩过程中优先级很低,需要手动打断防止消耗大量积分来回溯压缩前的工作进度。更糟的情况下,在压缩之后,用户的上次输入优先级会被抬到最高,trae很容易回到整个任务最开始的阶段。

举个例子,比如在用/spec模式的时候,派出了几个subagent去执行了一部分的step,但在压缩之后,很可能会重新加载skill,重新触发spec流程。

已经到节衣缩食的地步了。。那还不如放弃

3 个赞

笑死,都勒紧裤腰带过日子 :rofl:

GitHub - rtk-ai/rtk: CLI proxy that reduces LLM token consumption by 60-90% on common dev commands. Single Rust binary, zero dependencies · GitHub 再给你补充一个

确实AI的积分制,又push程序员继续学习,提示词工程等等 :smiling_face_with_tear:
不过大家每天都在开发啥,我一周的1-2个大任务基本每天签到+deepseek这个超省的也都够用了,不能每天都在重构模块和平台把

目前比较习惯他家的这种逻辑模式,我直接让他访问本地文件,然后给出命令,感觉比在ide里面好一些,请问其他家还有类似这种的吗