有点好奇长程任务的大佬们都是怎么保持正确性的

积分改制之后,经常看到一些动辄大几千上万分的单次任务

然而我的实际体感是:单次任务超过100积分(GLM-5.2),幻觉就显著上升,查代码的意愿就显著下降。有AGENTS.md,有trae自己的user_profile.md,没用,只有在明确指出后,大模型才会道歉然后说自己没有遵守。

工作流也足够完善,和大模型说任务边界说的清清楚楚,然而还是非常容易在任务规模扩大的时候,开始并行执行两个有明确前后依赖的任务,导致结果错误率非常高。

压缩问题更是重灾区,每次执行任务都得祈祷不要在写文档之前就压缩了,祈祷不要在压缩之后不看文档不确认进度直接从头开干然后撞上一堆冲突。

所以经常是不得不手动打断,补充一些信息或者方向上的指挥,或者是一份文档得开三四个任务不断修正。

基于这样的体验,我非常好奇,那些使用习惯是一次对话执行长程任务的大佬们,是如何确保准确率的呢?

试试IDE的goal模式

该我上场了

1 个赞

强强!准备用起来了

之前就反馈过,一直也没改,加个收尾阶段性hook的事儿
目前Trae,用户其实是没有任何强制性节点去做管控措施的
不对,生成文档类它自己就是会强制性标注"AI生成"…怎么强调也没用
阶段性注入,选择性注入,分阶段隔离等措施,完全无用…
/goal模式虽然只在ide上有,但是由于中间完全不可控
还是改变不了过程中不遵守规则和前期规划的阶段性行为被注意力忽视的问题
不知道啥时候才能改…

我问过 豆包,trae work 比 trae ide 更遵守 项目规则(project-rules.md),我已将 coding 切换到 trae work / code 模式下。

针对长程任务的个人体会:

  • 采用 豆包 不登陆(开放模式)下,通过问答形式完成需求文档。对于大型任务,有可能人工分解为几个小任务来进行。
  • 这些需求不仅仅是业务描述,还有代码逻辑和业务逻辑,以及 UI 的实现。
  • 通过这种方式,完善自己的需求,避免 在 trae 中开发过程中反复修改需求的盲目性。

有兴趣,可以参考我的文章 与AI达成一致,一场关于人机协作的访谈 ,希望对你有帮助。

rule辆三轮就没用了,一压缩就没了

其实要AI遵守约束,最好的方式是自己写Agent来管理

除非Agent能很好处理hook,能将你的hook指令预编译成脚本或代码,否则只要经过了LLM的大脑,就会面目全非