TAG:长上下文
小红书联手北京大学、上海交通大学提出HYPIC,给混合注意力大模型装上位置无关缓存,首token延迟砍掉3.25倍
小红书大模型推理团队联合北大、上交提出HYPIC,实现混合注意力大模型的位置无关缓存。系统解决现有PIC与线性注意力无法兼容问题,通过转移算子缓存、缝合窗口重算和段并行加速冷请求。实测首token延迟平均降低3.25倍,QPS提升1.66倍,任务质量仅差1.71分。完美适配RAG、多文档Agent等超长上下文负载。
小红书开源 RedKnot 推理引擎,长上下文处理效率翻倍,助力告别“长文本焦虑”
小红书技术团队开源RedKnot推理引擎,创新打破传统KV Cache按token维度存储模式,沿注意力头维度拆解并引入头分类稀疏、稀疏FFN、SegPagedAttention三大机制,实现长上下文推理效率大幅提升。实测TTFT加速1.6-3.54倍,并发提升4.7-7.8倍,FLOPs降低67%-79.5%,DeepSeek-V4-Flash在128K上下文下表现优异且精度保持95%以上。代码已开源,为高效AI推理提供新路径。
MiniMax M3即将发布:稀疏注意力架构突破 百万Token上下文效率显著提升
国内AI公司MiniMax即将发布新一代大模型M3,采用创新的稀疏注意力架构,通过Index Branch和Sparse Branch结合,有效解决百万Token上下文处理的计算瓶颈。相比前代M2,M3在Prefill和Decoding阶段速度分别提升9.7倍和15.6倍,显著降低推理成本,为长文本理解、多文档分析等应用提供高效支撑,推动大模型向效率与实用性转型。
通义实验室发布Qwen3.6-Plus AI编程迈入可靠新时代
通义实验室正式发布Qwen3.6-Plus模型,聚焦解决AI智能体编程任务执行不稳的痛点。该模型在编码能力、百万级长上下文及性价比上实现突破,深度兼容主流开发工具并支持视觉智能体闭环。现已通过阿里云百炼开放调用,助力开发者高效构建可靠AI编程工作流。
GPT-5.4意外炸场 GitHub源码泄露OpenAI王牌 200万超长上下文终结金鱼记忆时代
文章报道了OpenAI GPT-5.4模型因代码意外泄露而曝光的关键特性,包括高达200万tokens的超长上下文窗口和革命性的“状态化AI”能力,旨在实现跨会话的记忆与工作流连续性,以及像素级的原始图像读取功能。这标志着AI正从聊天助手向具备持久认知和自主执行能力的“数字员工”演进,可能彻底改变人机协作模式。