TAG:多模态模型

商汤开源SenseNova U1.5-Lite-Preview 8B模型 支持原生4K图像生成

商汤开源SenseNova U1.5-Lite-Preview 8B模型 支持原生4K图像生成

商汤科技开源轻量级统一多模态模型SenseNova U1.5-Lite-Preview。该模型基于NEO-unify架构,仅8B-MoT参数规模下实现原生4K图像生成、更细腻纹理、精准中英文文字渲染及稳定图像编辑能力。重点提升对长篇自然语言和结构化视觉指令的理解,支持参考图风格迁移、多图组合编辑及交互式调整。在多项基准测试中显著超越前代,有效降低多模态AI应用门槛。目前已在GitHub、Hugging Face及魔搭社区开放下载,为开发者提供高性能开源工具。

2026-08-03 21:34
3
0

MiniMax发布通用全模态模型H3:15秒2K音视频生成价格不到主流模型三分之一

MiniMax发布通用全模态模型H3:15秒2K音视频生成价格不到主流模型三分之一

MiniMax发布通用全模态模型H3,首次实现文本、图像、视频、音频的统一理解与生成,支持15秒2K双声道音视频输出,并以更低生成成本切入广告、电商、游戏等商业场景。其即将开源权重,也有望推动国产多模态生态与芯片适配加速发展。

2026-07-31 10:44
17
0

黑森林实验室FLUX3多模态模型发布,支持单次生成20秒音视频,性能超越Grok与Seedance

黑森林实验室FLUX3多模态模型发布,支持单次生成20秒音视频,性能超越Grok与Seedance

Black Forest Labs推出FLUX3多模态基础模型,支持单次生成20秒带原生音频的音视频,文生视频、图生视频、视频续写等全场景创作能力。人工评测中对比Grok Imagine Video胜率69%,图像编辑与机器人行为预测领域持续突破,展现统一架构的多模态领先优势。

2026-07-24 17:56
4
0

德国黑森林实验室推出Flux3:首个支持原生生成音频的多模态基础模型,20秒音画同步生成一次成型

德国黑森林实验室推出Flux3:首个支持原生生成音频的多模态基础模型,20秒音画同步生成一次成型

德国黑森林实验室(Black Forest Labs)正式推出多模态基础模型 Flux3,采用 Self-Flow 架构,内置音频、视频、图像及动作编解码器,实现原生音频生成,支持20秒音画同步。Flux3 在文本到图像、视频转视频、关键帧转场、多角色对话等任务中表现突出,在早期测试中以93%胜率超越Luma Ray3.2,77%胜率超越Runway Gen-4.5,并联合Mimic Robotics开发Flux-mimic机器人动作模型,已在奥迪工厂投入生产测试。Flux3Video已上线,Flux3I

2026-07-24 15:37
1
0

德国黑森林实验室发布Flux3多模态模型,支持原生音频生成并实现20秒音视频同步输出

德国黑森林实验室发布Flux3多模态模型,支持原生音频生成并实现20秒音视频同步输出

德国黑森林实验室Flux3多模态基础模型发布,基于Self-Flow架构,支持原生音频生成与20秒音视频同步输出,涵盖文本/图像/视频转视频等功能。性能远超Luma与Runway等顶级模型,进军机器人领域,Flux-mimic已在奥迪工厂测试。首批Flux3 Video现已上线,Flux3 Image与开源版将陆续发布,为AI内容创作与实体制造提供新突破。

2026-07-24 14:22
10
0

黑森林实验室发布Flux3多模态模型,首次支持20秒原生音视频同步生成

黑森林实验室发布Flux3多模态模型,首次支持20秒原生音视频同步生成

德国黑森林实验室发布Flux3多模态基础模型,基于Self-Flow架构打造,首次实现原生音频生成,可一次性输出20秒音视频同步片段。模型支持文本/图像/视频转视频、关键帧转场及多语言对话,在720p测试中性能超越Luma Ray3.2和Runway Gen-4.5,并推出Flux-mimic机器人动作模型,加速AI向具备感知与行动能力的“世界模型”演进。

2026-07-24 10:36
1967
0

110亿参数塞进六类科学大脑:上智院开放“神珍”多模态模型,从蛋白质到气象场一个模型全读懂

110亿参数塞进六类科学大脑:上智院开放“神珍”多模态模型,从蛋白质到气象场一个模型全读懂

文章介绍上海科学智能研究院开放的多模态科学基础模型“神珍”,其以约110亿参数统一处理DNA、RNA、蛋白质、小分子、气象场和医学影像六类数据,并在理解、生成与分割等任务中取得有竞争力表现,同时开放权重、代码与文档,便于科研复用与共建。

2026-07-21 12:06
4
0

Wan-Streamer v0.2发布:主打超低延迟AI对话体验,提升与AI实时沟通能力

Wan-Streamer v0.2发布:主打超低延迟AI对话体验,提升与AI实时沟通能力

文章介绍了通义实验室推出的 Wan-Streamer v0.2,这款端到端全模态模型以550毫秒超低延迟实现“听、看、说、演”一体化实时交互,并通过更清晰画质与全身数字人表现,显著提升 AI 对话的真实感与应用价值。

2026-07-17 16:43
139
0

前OpenAI CTO穆拉蒂推出多模态Inkling模型,称其为美国最强开源AI

前OpenAI CTO穆拉蒂推出多模态Inkling模型,称其为美国最强开源AI

前OpenAI CTO穆拉蒂创立的思维机器实验室发布从零训练的多模态Inkling开源AI模型,总参数975B(激活41B),上下文达百万tokens,预训练覆盖45万亿token,覆盖文本图像音频视频四模态。团队实力强劲,推理与编程仍落后中国开源模型,但多模态能力突出,在MMMU Pro和MMAU测试中与Gemini 3.1 Pro差距不大。

2026-07-16 16:32
5
0

穆拉蒂回归创业,思维机器实验室发布首款多模态开源模型 Inkling

穆拉蒂回归创业,思维机器实验室发布首款多模态开源模型 Inkling

前OpenAI CTO米拉·穆拉蒂创立的思维机器实验室发布首款多模态开源模型Inkling。模型采用MoE架构,总参数975B、激活41B,支持1M token上下文,预训练数据达45万亿tokens,涵盖文本、图像、音频与视频等多模态。通过Hugging Face和Thinker API全面开源,在数学、音频理解及通用指令跟踪等基准中取得领先优势,是当前美国开源AI领域最具竞争力模型之一。

2026-07-16 15:47
7
0

OpenAI再失大将:田永龙疑似加盟腾讯混元,将执掌多模态方向

OpenAI再失大将:田永龙疑似加盟腾讯混元,将执掌多模态方向

OpenAI前研究员田永龙疑似加盟腾讯混元,将执掌多模态模型方向。这是继姚顺雨之后,第二位OpenAI核心人才转投腾讯。田永龙拥有清华、MIT顶级履历,Google Scholar引用近2.9万次,曾提出有监督对比学习重要工作。其加入加速腾讯混元多模态团队人才拼图成型,彰显腾讯通过“OpenAI校友网络”在AI人才争夺战中的强势布局。

2026-07-08 14:38
4
0

OpenAI前研究员田永龙加盟腾讯混元多模态团队

OpenAI前研究员田永龙加盟腾讯混元多模态团队

OpenAI前研究员田永龙(Yonglong Tian)已加入腾讯混元团队,或将出任多模态模型方向负责人,主导视觉语言模型(VLM)研发。田永龙学术背景深厚,本科毕业于清华大学,MIT博士,Google Scholar引用近3万次。他提出的“有监督对比学习”(Supervised Contrastive Learning)影响深远,近期在Fluid系列自回归图像生成领域取得突破。此前曾在Google DeepMind和OpenAI任职,与腾讯首席AI科学家姚顺雨为旧识。此次加盟是腾讯加强多模态大模型布局的

2026-07-08 11:43
57
0

商汤科技秘密研发多模态模型U1Pro,由林达华牵头,预计7月启动内测并对标OpenAI

商汤科技秘密研发多模态模型U1Pro,由林达华牵头,预计7月启动内测并对标OpenAI

商汤科技正秘密研发多模态大模型U1Pro,由首席科学家林达华牵头,预计7月启动内测。该模型专注于设计场景,对标OpenAI的GPT-Image2,具备长程逻辑能力和8K超清输出,内部测试效果接近甚至超越GPT-Image2。这标志着AI图像生成技术正从娱乐向专业生产力工具演进,并加速多模态大模型在设计领域的竞争。

2026-06-25 17:37
4
0

国产多模态大模型 MiniMax M3 正式开源,响应速度倍增

国产多模态大模型 MiniMax M3 正式开源,响应速度倍增

稀宇科技MiniMax正式开源其原生多模态旗舰模型M3,该模型拥有428B总参数,是行业内首个从底层训练初期即进行多模态混合训练的开源大模型。发布后迅速在全球综合智能指数排行榜上斩获开源模型第一,响应速度从30 TPS优化至80 TPS。M3在编码与智能体能力评测中表现顶尖,能自主拆解复杂任务并调用工具,输出代码可直接交付,显著提升开发者生产力,标志着国产多模态大模型的重要里程碑。

2026-06-16 12:48
78
0

谷歌发布Gemma 4 12B模型,支持16GB内存本地即时响应,采用无编码器架构

谷歌发布Gemma 4 12B模型,支持16GB内存本地即时响应,采用无编码器架构

谷歌发布Gemma 4 12B多模态模型,采用颠覆性“无编码器”架构,彻底取消传统编码器组件,大幅降低模型复杂度和内存需求。该模型仅需16GB内存即可在消费级硬件上本地部署和即时响应,性能接近更大规模模型。作为开源项目,它支持多种推理框架,推动本地AI应用的普及,引发社区热议。

2026-06-04 15:57
3
0

推荐专栏

爱力方

爱力方

机器人前沿资讯及信息解读
机器人大讲堂

机器人大讲堂

中国顶尖的机器人专业媒体服务平台
关注爱力方,掌握前沿具身智能动态

© 2025 A³·爱力方

https://www.agentren.cn/