【开源基础模型训练平台】Marin|数据清洗到评测全流程公开,连失败记录都不藏着

很多开源模型只公布权重和技术报告,数据怎么清洗的、训练为什么失败、超参数怎么调的,这些过程性知识一概不公开,想复现根本无从下手。Marin 把训练模型的整个过程公开,包括实验配置、技术决策和失败记录。

项目定位

这是一套研究和训练基础模型的开源平台,定位是「完全透明的大模型训练流水线」。覆盖数据清洗、分词、预训练、后训练、模型评测完整流程,连失败经验都公开,方便其他团队复现和改进。

核心亮点

  1. 全流程覆盖,从数据到评测

    包括数据清洗、分词、预训练、后训练和模型评测等完整流程,不是只给一个训练脚本,而是完整的平台。

  2. 过程全公开,连失败记录都有

    实验配置、技术决策、失败记录全部公开,这种过程性知识比最终权重更有价值,让后来者少踩坑。

  3. 真正可复现

    因为过程透明、配置公开,其他团队可以真正复现训练结果,而不是对着权重和报告干瞪眼。

  4. 不止语言模型,扩展到多领域

    主要用于大模型研究,还被扩展到音频、DNA 和蛋白质模型,通用性很强。

适用场景

大模型训练研究、基础模型复现、学术研究团队、想学习完整训练流程的开发者、多模态 / 生物模型研究。

项目信息