TAG:AI音频生成

德国黑森林实验室推出Flux3:首个支持原生生成音频的多模态基础模型,20秒音画同步生成一次成型

德国黑森林实验室推出Flux3:首个支持原生生成音频的多模态基础模型,20秒音画同步生成一次成型

德国黑森林实验室(Black Forest Labs)正式推出多模态基础模型 Flux3,采用 Self-Flow 架构,内置音频、视频、图像及动作编解码器,实现原生音频生成,支持20秒音画同步。Flux3 在文本到图像、视频转视频、关键帧转场、多角色对话等任务中表现突出,在早期测试中以93%胜率超越Luma Ray3.2,77%胜率超越Runway Gen-4.5,并联合Mimic Robotics开发Flux-mimic机器人动作模型,已在奥迪工厂投入生产测试。Flux3Video已上线,Flux3I

2026-07-24 15:37
1
0

字节跳动发布Seed Audio 1.0:音频生成从“会说”迈向“会创作”

字节跳动发布Seed Audio 1.0:音频生成从“会说”迈向“会创作”

字节跳动正式发布Seed Audio 1.0音频生成模型,标志着AI音频创作从单一语音合成迈向完整声音场景创作。该模型端到端联合建模人声、音效与环境声,支持100毫秒级时空编排、稳定音色演绎及多语种(20余种)自然输出,在影视配音、广告等九大创作场景可用率超90%。从“会说”到“会创作”,它让高质量音频制作门槛大幅降低,帮助创作者高效实现脑海中声音构想。

2026-07-20 14:16
24
0

豆包音频生成模型1.0发布,开启音频导演时代

豆包音频生成模型1.0发布,开启音频导演时代

火山引擎发布了豆包音频生成模型1.0,凭借‘多模态参考生成’与‘长时音色一致性’两大核心技术,彻底革新了传统音频制作流程。用户只需输入包含角色台词、情绪语气、背景音乐等的Prompt,即可直接生成具备叙事张力的完整音频成片,解决了长音频创作中角色串戏的痛点。模型还支持0样本多模态创造,无需额外训练即可产出高质量音频,显著降低了专业音频制作的门槛。目前,模型已开放API邀测并将上线多个平台,推动音频创作从繁琐剪辑向高效创意导演演进,标志着AI成为内容创作者的全能助手。

2026-06-24 10:57
2
0

火山引擎发布豆包音频生成模型1.0,实现一句话生成影视级音频及10分钟角色声音一致性

火山引擎发布豆包音频生成模型1.0,实现一句话生成影视级音频及10分钟角色声音一致性

火山引擎发布豆包音频生成模型1.0,这是一款革命性的AI工具,支持通过一条Prompt快速生成包含对白、音效和背景音乐的完整音频作品,实现‘一句话生成影视级音频’。模型突破了长音频创作中角色声音一致性难题,确保10分钟以上音频不‘串戏’,并支持音色解耦控制,灵活适配多场景需求。现已开放API邀测,将极大提升有声剧、播客等音频内容的创作效率。

2026-06-24 10:57
3
0

推荐专栏

爱力方

爱力方

机器人前沿资讯及信息解读
机器人大讲堂

机器人大讲堂

中国顶尖的机器人专业媒体服务平台
关注爱力方,掌握前沿具身智能动态

© 2025 A³·爱力方

https://www.agentren.cn/