TAG:大模型训练
AI研究驶入“自动驾驶”时代:杨植麟详解大模型训练第三阶段
月之暗面(Moonshot AI)创始人杨植麟在2026中关村论坛年会上发表主旨演讲,提出AI研究正进入“AI主导研究”的第三阶段,即“自动驾驶”时代。从2026年起,AI系统将通过深度自演进与自我优化主导研发进程,取代传统人类精细调优模式。开源模型已成为行业新标准。这一范式转变将显著加速大模型训练效率,重构AI研发门槛与模式,为开发者与企业带来重要启示。
前OpenAI安全VP翁荔发布长文分析Scaling Laws,指出模型可能使用错误数据
前OpenAI安全研究副总裁翁荔在停更13个月后发表逾万字长文,深入拆解支撑大模型行业的Scaling Laws。文章追溯了从Kaplan到Chinchilla的行业共识演变,揭示当前模型训练数据配比可能从一开始就存在偏差,并探讨数据枯竭和Scaling Laws的工程敏感性,为AI从业者提供了关键反思和未来挑战。
谷歌DeepMind推出解耦式DiLoCo:优化异步训练架构 可容忍硬件故障
本文介绍谷歌DeepMind推出的解耦式DiLoCo分布式训练架构,该架构通过将训练任务分散到异步计算孤岛,解决传统同步训练易受单点硬件故障影响的问题,可大幅降低跨数据中心带宽需求,具备自愈能力且支持异构硬件协同,有效提升大模型训练效率与鲁棒性。
Meta收集员工日常行为数据用于训练大模型,隐私边界再受挑战
Meta推出“模型能力倡议”(MCI),计划收集员工鼠标点击、键盘输入与屏幕内容等日常工作行为数据,用于加速大模型“Muse Spark”训练,提升AI对人类使用计算机习惯的理解与操作能力。该举措同时引发隐私与数据安全担忧,员工关注数据处理边界与保护措施。
亚马逊进军内容授权市场 AI时代开启出版商新收益模式
亚马逊计划推出AI内容授权市场,为出版商与AI开发者搭建版权交易桥梁,终结数据免费使用时代。该平台将基于使用量计费,整合AWS生态,旨在解决版权争议并拓展亚马逊在AI领域的战略布局。微软等巨头也在布局类似市场,高质量数据授权成为AI竞争新焦点。
摩尔线程发布URPO框架:大模型训练新范式获AAAI 2026认可
摩尔线程在AAAI 2026会议上发布URPO框架,这是一种统一奖励与策略优化技术,通过将指令遵循和奖励评判功能整合到单一模型中,显著提升大语言模型的训练效率和性能。实验显示基于Qwen2.5-7B的URPO在AlpacaEval和RewardBench等基准测试中超越传统方法,为AI训练开辟了新路径。