TAG:大模型评测
DeepSeek-V4爆火背后:北大开源框架One-Eval如何终结AI测评“噩梦”
本文聚焦DeepSeek-V4发布后北大DCAI团队10小时完成自动化评测的案例,解析开源框架One-Eval如何以自然语言智能体、全链路可追溯与人工在环机制,破解大模型评测中的高门槛、黑盒与数据污染难题,并揭示评测产业“诊断+数据补全”的商业闭环及开源带来的行业变量。
AI编码工具战力榜揭晓 OpenClaw小龙虾领跑
OpenClaw最新发布的“小龙虾AI Agent排行榜”对主流大模型在真实编码任务中的表现进行了全面评测。榜单采用标准化测试方法,通过自动化代码检查和LLM智能评审双重机制,客观评估各模型的实际编码能力。Gemini3Flash、MiniMax M2.1和Kimi K2.5位列前三,Claude家族表现亮眼,而GPT-5.2和DeepSeek的成绩则出人意料。这份榜单为开发者选择AI编码助手提供了重要参考。
OpenClaw AI助手是否值得一试
本文通过《每日经济新闻》记者与开发人员的深度实测,评估了号称“AI打工人”的OpenClaw工具的实际表现。测试将其接入多款主流大模型,包括千问、Kimi、MiniMax、智谱和GPT-5-mini,考察其在文件检索、网络搜索、稿件撰写和邮件发送等任务中的能力。结果显示,不同模型表现差异显著,部分模型在关键环节如浏览器操控上存在困难,揭示了当前AI Agent在实用性、稳定性和信息安全方面面临的挑战。
蚂蚁数科上线 LingDT-2.6-flash,进一步为企业提供实用型 AI 工具
2026-04-29
0 浏览
毫厘智能 MOJANDA 330 荣获2026年度影响力汽车芯片奖
2026-04-29
0 浏览
擎天租获数亿元Pre-A轮融资
2026-04-29
0 浏览
笃行AI见实见效,2026深信服城市峰会南宁站圆满落幕
2026-04-29
0 浏览
OpenTenBase城市行深圳站举行,PostgreSQL核心开发者共探“AI+数据库”融合创新实践
2026-04-29
0 浏览
思看科技从工业级三维扫描起家拓展至消费级,关注机器人双目视觉领域丨新质生产力专题调研
2026-04-29
0 浏览
ima 上线知识 Agent Copilot:内置记忆系统,支持多端联动
2026-04-29
0 浏览
“全球AI光算力第一股”诞生,上海“芯片先锋队”再添新成员
2026-04-29
0 浏览
秘鲁东南部发生汽车相撞事故,至少10人死亡
2026-04-29
0 浏览
360智语跻身行业级智能体TOP15,“Agent+千行”构建智能升级新范式
2026-04-29
0 浏览