米国大豆包模型没怎么搞,paper一套一套的
概述:
Google、DeepMind 和 MIT 联合研究,260 个受控配置,几个值得借鉴的结论:
1、多智能体效果好不好,不取决于模型多强,而取决于任务结构是否适合分工。
2、三条判断依据:一是单智能体基线,超过 45% 再叠加智能体收益递减;二是任务能否并行分解,拆开后各部分的通信需求决定协调价值;三是防错靠验证环节,不是靠智能体数量。
3、五种架构各有定位:SAS 单智能体作基线,Independent 并行无通信成本最低收益也最低,Centralized 有中央节点交叉核验,Decentralized 无中心靠互相质询,Hybrid 两者结合但最复杂。
4、智能体数量有最优值,协调成本超线性增长,错误还会在系统里滚雪球。实测约 6 个智能体、69 轮推理接近拐点。
5、操作建议:先证明 2 到 3 个小规模有效,再决定是否扩展;效果不好先减数量,而不是换更强