WeChat Share Icon

GQA (分组查询注意力)

2026年8月2日

[!NOTE] 全称:GQA,中文释义:分组查询注意力。

💡 核心解析

该术语自动提取自深度专栏文章。

🚀 硅基视角

…,将非嵌入参数精准控制在 310 亿,压榨每一瓦特的算力价值。

  • 注意力机制瘦身:通过 GQA (分组查询注意力) 机制,部署 40 个 Q 头和 8 个 KV 头,从物理层面上极大降低了显存读写的内存带宽压力。
  • 上下文空间拉伸:在极低的能耗预算下,依然原生支持 131,0…

本条目由 GJNX AI 引擎自动挖掘并生成,旨在构建《硅基能效通识》知识体系。