
让大模型少说几千个推理token,可能比单纯提高每个token的生成速度更有价值。上海人工智能实验室发布35B基础模型Intern-S2-Mobius,开放权重、推理代码和技术报告。它没有沿用Transformer把知识存储和推理运算逐层捆绑的方式,而是把知识集中进全局共享Memory,让多个Reasoner反复读取并在连续隐藏状态中完成推演。官方测试中,其平均请求吞吐随批量从约2.9倍升至4.6倍,但这仍是团队内部结果。
传统Transformer中,每层自注意力主要处理上一层传来的状态,再调用本层前馈网络中的知识。若关键知识没有在浅层被激活,模型常要先生成中间token,把信息带入下一次完整前向计算。Mobius把各层前馈网络对应的知识向量横向合并为共享仓库,再用类似混合专家的分块稀疏激活控制开销。这样,较深的Reasoner也能访问原本位于较浅位置的知识,团队把这种效果称为“反向残差连接”。
第二个变化是动态潜在推理。模型把试探、修正和多轮思考的一部分留在连续向量里,经过少量层反复迭代后再并行解码多个token。它不是把隐藏思考直接展示给用户,而是尝试减少必须写出来的冗长推理链。知识仓仍要占用内存,稀疏访问也会增加带宽压力,因此这不是把每次前向计算免费变快,而是用更复杂的单次计算换更短的端到端路径。
在MMLU Pro、GPQA Diamond、IMO Bench、AIME 2026和HMMT 2026五组任务上,官方图表显示:批量为16时,Mobius平均请求吞吐约为Transformer对照的2.9倍;批量增至256时,差距扩大到4.6倍。不同任务并非始终同幅提升,AIME和HMMT在部分批量点上也出现对照模型更快的情况,说明收益受问题类型和并发状态影响。
更关键的解释来自输出长度。五项任务的平均输出缩短约1.2至5倍,其中MMLU Pro和GPQA Diamond分别缩短4.6倍与5倍。团队认为模型把一部分推演压进潜在空间,因此能用更少显式token完成相同步骤;但报告也承认,为什么短链仍能保留推理质量尚未被完全解释。图表没有给出足以复现实验的完整硬件、并行、推理引擎版本和服务配置,4.6倍不能直接写成任意部署都能获得的固定加速。
Intern-S2-Mobius在九项通用评测上的平均分为67.88,对照Qwen3.5-35B为65.05;科学任务平均分为52.14,对照为18.20,生物指令、分子指令和MolecularIQ提升明显。不过,它在UGD hard上得到73.02,低于对照的78.02;HLE为19.11,也低于22.40。选取的科学任务数量较少,且对照只有一个同规模底模,不能据此推断对所有35B模型或真实科研工作都更强。
团队还用7B-A1B模型做了从零训练实验:Mobius用对照约62.6%的训练数据达到接近的MMLU成绩。这支持“知识压缩更高效”的方向,却没有消除架构转换、继续预训练数据和后训练方法带来的影响。35B版本经过监督微调与强化学习,公开分数是整套训练配方的结果,不能全部归功于共享Memory。
模型以BF16权重发布,文件分为5个Safetensors分片,并提供MTP推测解码与普通服务示例。35B体量依然需要可观显存,官方的单卡示例只是接口形式,不代表任意消费级显卡都能无量化运行。部署还依赖远程自定义模型代码或较新的推理框架,企业应固定提交版本、审查代码,并分别测量首token延迟、持续吞吐、长上下文、批量抖动和答案稳定性。
ATYUN认为,Mobius最值得关注的不是又一张平均分表,而是它把大模型效率竞争推进到“知识如何存、推理如何循环”的架构层。权重和报告已开放,让外部团队有机会复测4.6倍是否成立。下一步真正决定影响力的,是同硬件同引擎下能否稳定复现吞吐,以及更短推理链是否在代码、工具调用和长时智能体任务中仍保持可验证的正确性。
