NEWS / 摘要

Qwen2.5-Max:探索大规模 MoE 模型的智能

来源摘要

QWEN CHAT API DEMO DISCORD 过去有一种观点认为,持续地增长数据规模和模型参数规模是一种通向 AGI 的可能的路径。然而,整个大模型社区对于训练超大规模的模型的经验都相对匮乏,不论是稠密模型还是 MoE 模型。近期,DeepSeek V3 的发布让大家了解到超大规模 MoE 模型的效果及实现方法,而同期,Qwen 也在研发超大规模的 MoE 模型 Qwen2.5-Max,使用超过 20 万亿 token 的预训练数据及精心设计的后训练方案进行训练。今天,我们很高兴能给大家分享 Qwen2.5-Max 目前所取得的成果。大家可以通过…

摘要由机器生成(来自来源站点),可能存在偏差; 本站不转载全文,请以原文为准。