TAG:视觉大模型
小鹏发布TuringViT视觉编码器:仅用十分之一数据,性能超越SOTA基线
文章介绍了小鹏发布的TuringViT高效视觉编码器,重点解析其在线性注意力架构、数据治理流水线和动态分辨率训练上的创新。该模型仅用约十分之一训练数据,便在多项零样本分类与图文检索任务中超越主流SOTA基线,并面向智能驾驶、智能座舱和人形机器人落地。
商汤开源SenseNova-Vision统一视觉大模型,可单模型覆盖四大核心视觉任务
文章介绍了商汤全面开源SenseNova-Vision统一视觉大模型,强调其以单模型覆盖目标检测、分割、深度估计和多视角3D重建四大核心视觉任务,并在多项权威评测中领先同类通用模型及部分专家模型,同时同步开源5000万条视觉指令数据集。
视觉大模型评测遇挑战,首个中国古文字OCR基准开源
文章介绍了首个完整覆盖中国古文字‘七体之变’的OCR评测基准‘Chronicles-OCR’的开源。该基准由腾讯混元大模型等机构联合多所高校与故宫博物院推出,包含2800张高质量图像,用于评估AI模型识别古文字的能力。评测结果显示,主流视觉大模型在古文字识别上表现不佳,最高准确率仅27.1%,并揭示了模型在微观笔画识别上的短板。这一基准为未来视觉大模型从‘识字’走向‘读史’提供了明确优化方向。
智谱发布GLM-5V-Turbo 全面强化AI智能体视觉感知能力
智谱正式发布多模态Coding基座模型GLM-5V-Turbo,深度融合视觉感知与编程能力。该模型支持200k超长上下文,能精准解析设计稿与网页界面,实现草图秒级转前端代码,并赋能智能体自主探索。它的推出标志着AI编程迈入视觉感知新阶段,极大提升开发效率。
美股三大指数震荡整理,芯片股走高,光通信板块大涨
2026-05-11
0 浏览
多空胶着恒指震荡整理,AI景气外溢主导行情波动
2026-05-11
0 浏览
宠物AI公司PurrPurr获阿尔法公社投资 首年GMV目标5000万
2026-05-11
0 浏览
隆源股份业绩说明会回应今年新能源汽车零部件领域新客户洽谈中
2026-05-11
0 浏览
中国品牌市占率达75%,4月我国汽车销量约252.6万辆,新能源汽车出口贡献度近五成
2026-05-11
0 浏览
4月汽车出口增长51% 国内零售下跌超20%
2026-05-11
0 浏览
4月全国新能源汽车渗透率历史首次突破60%,燃油车零售同比暴跌37%
2026-05-11
0 浏览
港股复盘:强势翻红 芯片概念股冲高回落 短期风险需警惕
2026-05-11
0 浏览
申昊科技拟设具身智能子公司 加码人形机器人业务
2026-05-11
0 浏览