TAG:API
DeepSeek V4 正式版疑定档 8 月 3 日:硅基流动涨价泄露线索,API 已能答对新题
DeepSeek V4 正式版疑定档8月3日,硅基流动API缓存命中价从0.1元暴涨至1.0元,官方动机指向新版上线。开发者实测显示API已能准确回答Claude Opus 4.5等模型日期,灰度测试迹象清晰。服务波动、迭代磨合加速,OpenAI降价80%压境,GLM国内涨价,DeepSeek能否用性能在8月3日开卷挑战?
OpenAI 计划将 ChatGPT 集成到眼镜等可穿戴设备:布罗克曼关注可穿戴领域,API 仍处于早期雏形阶段
OpenAI总裁格雷格·布罗克曼表示,公司正积极探索将ChatGPT及AI能力集成进可穿戴设备,尤其是智能眼镜。他透露API正处于早期阶段,旨在为第三方硬件提供语音交互等接入,让用户在眼镜等设备上实现更全面的AI操控,而非仅依赖手机屏幕。目前已有Rokid等眼镜产品已接入OpenAI模型,Meta、谷歌等巨头也在加速类似项目。
OpenRouter将语音转录接入同一API:一份密钥即可同时支持聊天和转写,Whisper与按token计价STT一并上线
OpenRouter最新集成语音转录端点,让开发者只需一张OpenRouter密钥即可完成聊天与语音转写(Whisper和按token计费STT模型)。支持base64音频上传、OpenAI兼容客户端无缝迁移,无需额外SDK或第三方服务。Playground内可直接测试,响应包含text、usage和追踪ID,零补全保险保障可靠性。
字节跳动 Seedance 2.5 模型将于7月16日全量开放 API
字节跳动旗下Seedance2.5视频生成模型将于7月16日全量开放API,标志着该模型从灰度测试走向全面商用。模型在单段30秒原生视频直出、最多50个全模态素材参考及高可控视频编辑功能上实现技术突破,进一步降低高品质视频生成门槛,预计将加速AI视频工具在影视创意和商业广告领域的工程化落地。
Meta 调整 AI 开发节奏:Llama API 公共预览版明日下线
Meta今日宣布,将于2026年7月6日正式下线Llama API公共预览服务。该服务作为开发者测试窗口已完成阶段使命。Llama模型本身不受影响,开发者可继续官方下载使用。Meta建议用户迁移至第三方Llama服务,并计划推出全新、更高效的开发者工具,详情即将公布。
谷歌全面扩容Gemini API免费额度:部分模型单分钟吞吐量翻至百万级
谷歌Gemini API免费额度大幅扩容,Gemini 2.5 Flash与Flash-Lite模型在部分账号实现单分钟100万Token超高吞吐。该免费层级保持免绑卡、不限总量的极低门槛,为个人开发者与初创团队提供高性价比AI试错空间。尽管存在RPM/RPD限制及免费数据可用于模型训练的风险,此举显著降低AI应用开发门槛,助力谷歌吸引开发者生态并巩固市场领先地位。
算力告急:谷歌限制Gemini模型调用,Meta研发进度受阻
谷歌因Gemini API调用量自2025年春季翻倍,于2026年5月17日起实施算力配额与频率限制,导致Meta因需求巨大而多项AI研发项目严重受阻。公司紧急要求优化代码和令牌使用效率以压缩成本。这一事件凸显全球AI算力基础设施建设滞后于爆发式应用需求的行业现实。
AI组队“拼单”新模式:OpenRouter发布Fusion API,主打性能与性价比双重优化
OpenRouter近日发布Fusion API,这是一项多模型协同服务,通过并行处理多个AI模型并整合结果,实现性能与成本的双重优化。基准测试显示,该方案在性能上超越了Claude Fable5等领先模型,同时成本可降低约一半,显著提升性价比。这为开发者提供了新的技术路径,有助于在AI大模型应用中优化资源配置并降低调用成本。
DeepSeek 拟采用蜜雪冰城打法 打造中国版 Claude Code
DeepSeek 通过永久降价 V4‑Pro API,将输入缓存成本降至 0.025 元/百万 token,输出降至 6 元,并提供 500 并发,显著提升性价比,为开发者和企业提供更具竞争力的 AI 接口。
亚马逊 SageMaker AI 推出兼容 OpenAI API 的实时推理端点
亚马逊 SageMaker AI 近期推出兼容 OpenAI API 的实时推理端点,用户只需更改端点 URL 即可使用 OpenAI SDK、LangChain 等工具无缝调用模型,无需额外代码定制。该功能支持多模型托管、流式输出,并简化了 Bearer Token 认证流程,使现有应用程序能轻松集成,提供高效灵活的 AI 推理解决方案。
Google 升级 Gemini API 文件搜索,多模态 RAG 能力增强
Google 近期对 Gemini API 的文件搜索功能进行了重大升级,引入了多模态检索增强生成(RAG)能力。此次更新基于 Gemini Embedding2 模型,支持文本、图像和复杂文档的统一处理,使 AI 能够深度理解视觉元素如图表和设计图。开发者无需搭建复杂系统,即可实现完整的 RAG 工作流,显著提升客服机器人和文档分析等企业级应用的准确性。新增的自定义元数据过滤和页面级引用功能进一步优化了信息检索的效率和透明度,目前已向全球开发者开放。
OpenAI 发布官方 CLI 工具 openai-cli:一行命令即可调用 Responses API 与全套 Agent 工具
OpenAI 正式发布官方命令行工具 openai-cli,开发者可通过终端一行命令直接调用 Responses API 和全套 Agent 工具,如 Web 搜索、代码解释器等。该工具开源且安装简便,支持结构化输出和管道操作,简化多模态 AI 任务(如图像生成、语音转录)的接入,提升本地开发、自动化脚本和 DevOps 效率,填补了 OpenAI 工具链在命令行领域的空白。
Chrome 正式发布 Prompt API,网页可直接调用 Gemini Nano 本地模型,浏览器原生 AI 时代来临
本文介绍 Chrome 正式推出 Prompt API,开发者可在网页中直接调用浏览器内置的 Gemini Nano 本地模型,实现离线推理、隐私保护与更低接入成本,并解析其核心优势、当前限制及对 Web AI 生态的行业意义。
OpenAI语音API全面升级:转录精度提升 代理速度提升40%
OpenAI 发布两项重要 API 更新,包括全新的实时模型 gpt-realtime-1.5 和引入 WebSocket 协议的 Responses API。新模型显著提升了数字、字母转录及语音指令执行的准确率,而架构改进则使复杂 AI 代理的运行速度大幅提升 20%-40%,全面优化了语音交互与任务处理性能。
谷歌AI云业务半年翻倍,从烧钱换量转向质量盈利,企业落地仍存分歧
文章分析了谷歌Gemini API调用量半年内翻倍增长的现象,揭示了谷歌AI云业务从烧钱扩张转向质量盈利的战略转变。文章指出,虽然Gemini新版本提升了利润率并吸引了大量企业客户,但在具体业务场景落地时仍面临用户评价分化和产品易用性挑战。