TAG:视觉大模型

小鹏发布TuringViT视觉编码器:仅用十分之一数据,性能超越SOTA基线

小鹏发布TuringViT视觉编码器:仅用十分之一数据,性能超越SOTA基线

文章介绍了小鹏发布的TuringViT高效视觉编码器,重点解析其在线性注意力架构、数据治理流水线和动态分辨率训练上的创新。该模型仅用约十分之一训练数据,便在多项零样本分类与图文检索任务中超越主流SOTA基线,并面向智能驾驶、智能座舱和人形机器人落地。

2026-07-21 15:51
819
0

商汤开源SenseNova-Vision统一视觉大模型,可单模型覆盖四大核心视觉任务

商汤开源SenseNova-Vision统一视觉大模型,可单模型覆盖四大核心视觉任务

文章介绍了商汤全面开源SenseNova-Vision统一视觉大模型,强调其以单模型覆盖目标检测、分割、深度估计和多视角3D重建四大核心视觉任务,并在多项权威评测中领先同类通用模型及部分专家模型,同时同步开源5000万条视觉指令数据集。

2026-07-13 14:20
970
0

视觉大模型评测遇挑战,首个中国古文字OCR基准开源

视觉大模型评测遇挑战,首个中国古文字OCR基准开源

文章介绍了首个完整覆盖中国古文字‘七体之变’的OCR评测基准‘Chronicles-OCR’的开源。该基准由腾讯混元大模型等机构联合多所高校与故宫博物院推出,包含2800张高质量图像,用于评估AI模型识别古文字的能力。评测结果显示,主流视觉大模型在古文字识别上表现不佳,最高准确率仅27.1%,并揭示了模型在微观笔画识别上的短板。这一基准为未来视觉大模型从‘识字’走向‘读史’提供了明确优化方向。

2026-05-19 18:42
60
0

智谱发布GLM-5V-Turbo 全面强化AI智能体视觉感知能力

智谱发布GLM-5V-Turbo 全面强化AI智能体视觉感知能力

智谱正式发布多模态Coding基座模型GLM-5V-Turbo,深度融合视觉感知与编程能力。该模型支持200k超长上下文,能精准解析设计稿与网页界面,实现草图秒级转前端代码,并赋能智能体自主探索。它的推出标志着AI编程迈入视觉感知新阶段,极大提升开发效率。

2026-04-02 17:33
5
0

推荐专栏

爱力方

爱力方

机器人前沿资讯及信息解读
机器人大讲堂

机器人大讲堂

中国顶尖的机器人专业媒体服务平台
关注爱力方,掌握前沿具身智能动态

© 2025 A³·爱力方

https://www.agentren.cn/