https://lnkd.in/p/g2z9VdyD
LinkedIn
這篇文把 GPT-2 到 Kimi K3,到底改變了什麼,徹底解析了一番!
GPT-2 用的是 softmax 注意力,為了知道哪個字重要,它把讀過的每個字都留在 KV cache… | LargitData
GPT-2 用的是 softmax 注意力,為了知道哪個字重要,它把讀過的每個字都留在 KV cache… | LargitData
這篇文把 GPT-2 到 Kimi K3,到底改變了什麼,徹底解析了一番!
GPT-2 用的是 softmax 注意力,為了知道哪個字重要,它把讀過的每個字都留在 KV cache 裡,像一本愈翻愈厚的筆記本。內容愈長,要搬的資料愈多,最後卡在記憶體頻寬。
線性注意力換了個想法:不留全部,只把讀過的內容壓縮進一塊固定大小的白板。不管輸入多長,成本都一樣。缺點是抓重點的能力變差,而且新資訊只能一直往上疊,疊久了混成一團,該用的時候找不清楚。
DeltaNet 針對這點,寫之前先看那個位置原本放了什麼…
GPT-2 用的是 softmax 注意力,為了知道哪個字重要,它把讀過的每個字都留在 KV cache 裡,像一本愈翻愈厚的筆記本。內容愈長,要搬的資料愈多,最後卡在記憶體頻寬。
線性注意力換了個想法:不留全部,只把讀過的內容壓縮進一塊固定大小的白板。不管輸入多長,成本都一樣。缺點是抓重點的能力變差,而且新資訊只能一直往上疊,疊久了混成一團,該用的時候找不清楚。
DeltaNet 針對這點,寫之前先看那個位置原本放了什麼…