· liyu · ai
深入大模型注意力演进:MHA、MQA 与 GQA 的张量计算与优缺点全景剖析
聚焦大模型三大核心注意力机制:多头注意力(MHA)、多查询注意力(MQA)与分组查询注意力(GQA)。从张量维度(Tensor Shapes)与计算流出发,深度解读前向传播中矩阵的行、列、元素物理含义,剖析三者的优缺点与显存带宽权衡。
聚焦大模型三大核心注意力机制:多头注意力(MHA)、多查询注意力(MQA)与分组查询注意力(GQA)。从张量维度(Tensor Shapes)与计算流出发,深度解读前向传播中矩阵的行、列、元素物理含义,剖析三者的优缺点与显存带宽权衡。
当你在浏览器地址栏输入 URL 并按下回车,到网页绚丽呈现,这背后究竟经历了什么?从 HTTP 报文构建、DNS 分级解析,到操作系统内核协议栈封包、ARP 寻址,再到网卡、交换机、路由器的物理传输与服务端响应、浏览器渲染,本文带你完成一次穿透软硬件的全景探秘。
从暴力 KNN 的 O(N × D) 算力瓶颈,到 IVF、HNSW、IVF-PQ 的亚线性近似检索原理;从搜广推全链路端到端 SLA 预算分配,到工业级向量索引在维度、内存、动态更新与属性过滤下的全景选型决策。
搜广推系统中的双塔模型和 RAG 中的向量检索,一个诞生于推荐系统,一个兴起于大模型时代。当我把两者的架构图放在一起时,突然发现它们竟如此相似——本质上都是在向量空间中寻找最近的"灵魂伴侣"。
在搜广推系统中,搜索是最核心的能力之一。本文从信息检索的经典算法 TF-IDF 出发,深入剖析其原理与局限,再引出工业界广泛使用的 BM25 算法,探讨它如何优雅地解决 TF-IDF 的不足。
作为一个软件工程研究生,我决定开始记录自己的技术探索和思考。这篇文章聊聊我为什么选择写博客,以及我希望在这里分享什么。