法国人工智能公司Mistral AI向公众开放了Large 4的预览版,这是一款拥有万亿参数的大模型,内部昵称"le Chonk"。这是迄今为止首个完全在欧洲本土训练完成的超大规模AI系统,整个训练过程没有使用美国或中国的云计算资源。
万亿参数并不意味着每次回答问题都要调用全部参数。Large 4采用混合专家(MoE)架构:模型内部储备了大量专门处理不同任务的"专家"子网络,但每次处理具体请求时,只会激活其中约490亿参数——也就是当前任务真正需要的那部分专家。这有点像一栋有几百个办公室的大楼,只有正在使用的房间才会开灯。
该模型从零开始训练,耗时约两个月,使用了大约4000块英伟达Grace Blackwell芯片,全部部署在Mistral位于法国的自建数据中心。训练数据覆盖160多种语言,包括欧盟所有官方语言,上下文窗口最高可达100万个token。
根据Mistral自己公布的测试结果,Large 4在网络安全相关任务上表现突出,例如在Cybench安全测试中取得93%的成绩,在编程和金融分析类基准测试中也有不错表现。不过这些数据目前还没有经过第三方独立验证,而阿里巴巴、DeepSeek、智谱等竞争对手采用的测试标准各不相同,直接比较的意义有限。
这次发布对欧洲意义特别重大。此前开源大模型的竞争基本是美国和中国实验室之间的事——Meta、DeepSeek、阿里巴巴、月之暗面概莫能外。Mistral多年来一直打着"数字主权"的旗号获得法国政府和投资者的支持,Large 4是这笔投入第一次拿出足够分量的成果。
完整的模型权重计划于10月27日开源,到那时全球开发者才能在自己的硬件上运行Large 4,亲自验证Mistral给出的各项数据是否站得住脚。



