TAG:MoE
2026年7月16日,月之暗面发布Kimi K3大模型,该模型拥有2.8万亿参数,登顶全球最大开源模型,特斯拉CEO马斯克点赞
月之暗面开源 Kimi K3:2.8万亿参数 MoE 混合专家模型,首创视觉理解与100万token上下文,支持AgentEnv智能体沙箱、MoonEP与FlashKDA训练基础设施。发布权重与技术报告,登顶AI代码评测榜首,马斯克留言称赞,拓展大模型训练与智能体生态全体系,降低国产开源门槛。
阿里真武M890超节点已成功适配Qwen3.8,马斯克称量产Optimus人形机器人仍面临挑战
7月23日报道:阿里真武M890超节点已成功适配Qwen3.8大模型(2.4万亿参数),成为国内首个支持超2万亿参数MoE模型推理的超节点,显存9TB,支持800GB/s高速互联。马斯克称Optimus量产面临制造环节重新建立的挑战。北京发布措施推动跨模型跨芯片通用智能体技术攻关。国产AI闭环技术突破与行业挑战解读。
Poolside 重磅开源,Laguna S 2.1 免费上线 OpenCode,1M 超长上下文与 118B MoE 模型引领代理编码新阶段
Poolside 推出 Laguna S 2.1 免费开源!118B MoE 模型 1M 超长上下文 + 每 token 激活 8B 参数,支持 thinking/no-thinking 模式,单台 NVIDIA DGX Spark 即可高效运行,性能直逼更大参数模型。OpenMDW-1.1 完全开放,在 OpenCode 和 Hugging Face 立即免费使用,Terminal-Bench2.1 达 70.2%,DeepSWE 等基准展现强劲代理编码能力。引领本地代理 AI 新纪元,加速软件工程长周
腾讯混元Hy3限免活动延长至8月5日,295B MoE模型白嫖期续命
腾讯混元Hy3大模型刚开源不到半个月,用户一句“再来两周”的呼声就让免费期从两周延长至8月5日。Hy3采用MoE架构(295B总参数,21B激活),支持256K长上下文,快慢思考融合,在推理、长文档、代码库等任务上已接近旗舰水平。给白嫖爱好者提供了实打实的“续命”机会,开启高效性价比新篇章。
阿里黑科技炸场!0.6B 小模型“魔改”成 17B MoE,激活参数仅 5%,CPU 直接跑 30token/s!
本文介绍阿里国际数字商业团队推出的Marco-Mini-Instruct MoE模型,该模型通过Upcycling技术由0.6B小模型升级为17B总参数规模,激活参数仅5%,CPU上可实现30token/s的推理速度,性能超越4B级Dense模型,为行业提供了低成本、高效率的MoE炼制新路径,大幅降低中小团队落地MoE的门槛。
蚂蚁开源Ring-flash-linear-2.0-128K模型,混合注意力与MoE架构提升长文本编程效率
在AI大模型竞争白热化的当下,高效推理与长上下文处理已成为开发者痛点。近日,蚂蚁集团旗下百灵大模型团队正式开源Ring-flash-linear-2.0-128K,一款专为超长文本编程设计的创新模型。
AI算力的“B计划”:当AMD与IBM联手,用1024张MI300X,炼出了第一个“非NVIDIA”大模型
AMD携手IBM与Zyphra发布全球首个纯AMD硬件训练的大模型ZAYA1,采用MoE架构预训练14T tokens,性能与Qwen3系列持平。ZAYA1创新性采用CCA注意力机制和线性路由MoE,在数学推理等STEM领域表现优异,验证了AMD MI300X+ROCm在大规模模型训练中的可行性。