TAG:长上下文

小红书联手北京大学、上海交通大学提出HYPIC,给混合注意力大模型装上位置无关缓存,首token延迟砍掉3.25倍

小红书联手北京大学、上海交通大学提出HYPIC,给混合注意力大模型装上位置无关缓存,首token延迟砍掉3.25倍

小红书大模型推理团队联合北大、上交提出HYPIC,实现混合注意力大模型的位置无关缓存。系统解决现有PIC与线性注意力无法兼容问题,通过转移算子缓存、缝合窗口重算和段并行加速冷请求。实测首token延迟平均降低3.25倍,QPS提升1.66倍,任务质量仅差1.71分。完美适配RAG、多文档Agent等超长上下文负载。

2026-07-17 16:54
11
0

小红书开源 RedKnot 推理引擎,长上下文处理效率翻倍,助力告别“长文本焦虑”

小红书开源 RedKnot 推理引擎,长上下文处理效率翻倍,助力告别“长文本焦虑”

小红书技术团队开源RedKnot推理引擎,创新打破传统KV Cache按token维度存储模式,沿注意力头维度拆解并引入头分类稀疏、稀疏FFN、SegPagedAttention三大机制,实现长上下文推理效率大幅提升。实测TTFT加速1.6-3.54倍,并发提升4.7-7.8倍,FLOPs降低67%-79.5%,DeepSeek-V4-Flash在128K上下文下表现优异且精度保持95%以上。代码已开源,为高效AI推理提供新路径。

2026-06-30 11:47
14
0

MiniMax M3即将发布:稀疏注意力架构突破 百万Token上下文效率显著提升

MiniMax M3即将发布:稀疏注意力架构突破 百万Token上下文效率显著提升

国内AI公司MiniMax即将发布新一代大模型M3,采用创新的稀疏注意力架构,通过Index Branch和Sparse Branch结合,有效解决百万Token上下文处理的计算瓶颈。相比前代M2,M3在Prefill和Decoding阶段速度分别提升9.7倍和15.6倍,显著降低推理成本,为长文本理解、多文档分析等应用提供高效支撑,推动大模型向效率与实用性转型。

2026-05-27 14:19
1
0

通义实验室发布Qwen3.6-Plus AI编程迈入可靠新时代

通义实验室发布Qwen3.6-Plus AI编程迈入可靠新时代

通义实验室正式发布Qwen3.6-Plus模型,聚焦解决AI智能体编程任务执行不稳的痛点。该模型在编码能力、百万级长上下文及性价比上实现突破,深度兼容主流开发工具并支持视觉智能体闭环。现已通过阿里云百炼开放调用,助力开发者高效构建可靠AI编程工作流。

2026-04-02 16:59
5
0

GPT-5.4意外炸场 GitHub源码泄露OpenAI王牌 200万超长上下文终结金鱼记忆时代

GPT-5.4意外炸场 GitHub源码泄露OpenAI王牌 200万超长上下文终结金鱼记忆时代

文章报道了OpenAI GPT-5.4模型因代码意外泄露而曝光的关键特性,包括高达200万tokens的超长上下文窗口和革命性的“状态化AI”能力,旨在实现跨会话的记忆与工作流连续性,以及像素级的原始图像读取功能。这标志着AI正从聊天助手向具备持久认知和自主执行能力的“数字员工”演进,可能彻底改变人机协作模式。

2026-03-03 11:40
2
0

推荐专栏

爱力方

爱力方

机器人前沿资讯及信息解读
机器人大讲堂

机器人大讲堂

中国顶尖的机器人专业媒体服务平台
关注爱力方,掌握前沿具身智能动态

© 2025 A³·爱力方

https://www.agentren.cn/