BR收藏
12:50 · 2026年7月30日 · 週四
https://www.instagram.com/reel/DanQBFikgVn/?igsh=aXdnYzEwdzl4dDYx
12:20 · 2026年7月30日 · 週四
https://www.instagram.com/reel/DaxfysTApnr/?igsh=ejN0eHZlbnJpOGZq
01:21 · 2026年7月30日 · 週四
https://www.instagram.com/reel/DbYLPRrkUnf/?igsh=MXFsc3B6NG5pcWJvYQ==
00:56 · 2026年7月30日 · 週四
https://github.com/Dokploy/dokploy
GitHub
GitHub - Dokploy/dokploy: Open Source Alternative to Vercel, Netlify and Heroku.
Open Source Alternative to Vercel, Netlify and Heroku. - Dokploy/dokploy
00:53 · 2026年7月30日 · 週四
https://www.threads.com/share/FeVnkZVOQ/
22:59 · 2026年7月29日 · 週三
https://www.instagram.com/reel/DbXgkWclb_j/?igsh=Z2xyOHZ1ZXR1YmFt
22:59 · 2026年7月29日 · 週三
https://www.instagram.com/reel/Dar9_-Eh_8I/?igsh=b3AxbGJ6ZmN4aXpx
18:21 · 2026年7月29日 · 週三
https://www.instagram.com/reel/DbVb43pjfu8/?igsh=bG5nbDkxM2ZwN3Zx
16:03 · 2026年7月29日 · 週三
https://www.instagram.com/p/DbXeWfVGzGL/?igsh=eGt6aTcxeG0zdWw2
15:23 · 2026年7月29日 · 週三
https://www.instagram.com/p/DbOg6BlFIHC/?img_index=5&igsh=eWJka3hpNnNvaG5y
Instagram
Instagram
Media number out of range
15:23 · 2026年7月29日 · 週三
https://www.instagram.com/reel/DYUsjMCDa_w/?igsh=MzllazZqeXZpc2do
05:18 · 2026年7月29日 · 週三
https://www.instagram.com/reel/DaF1wmRTHdr/?igsh=OW9xcXlleTNnZjV1
05:08 · 2026年7月29日 · 週三
https://www.instagram.com/reel/DZX11flJbmo/?igsh=Y2lmd3QwZTh2a281
05:07 · 2026年7月29日 · 週三
https://www.instagram.com/reel/DaNZFz5Sc_A/?igsh=MTA2MjQzb2J2bGFz
05:05 · 2026年7月29日 · 週三
https://www.instagram.com/reel/DX14P6HJSsm/?igsh=YzR4Nmswb2M2eXow
04:55 · 2026年7月29日 · 週三
https://www.instagram.com/reel/DbQw30hTm1Y/?igsh=NHIwN296Y3FtaTk=
Instagram
Instagram
Post might not be available
04:55 · 2026年7月29日 · 週三
https://www.instagram.com/reel/DXx87BuM1Ps/?igsh=dWRkbTVkY3Exc2s=2,000
msecs
00:13 · 2026年7月29日 · 週三
https://lnkd.in/p/g2z9VdyD
LinkedIn
這篇文把 GPT-2 到 Kimi K3,到底改變了什麼,徹底解析了一番!
GPT-2 用的是 softmax 注意力,為了知道哪個字重要,它把讀過的每個字都留在 KV cache… | LargitData
這篇文把 GPT-2 到 Kimi K3,到底改變了什麼,徹底解析了一番!
GPT-2 用的是 softmax 注意力,為了知道哪個字重要,它把讀過的每個字都留在 KV cache 裡,像一本愈翻愈厚的筆記本。內容愈長,要搬的資料愈多,最後卡在記憶體頻寬。
線性注意力換了個想法:不留全部,只把讀過的內容壓縮進一塊固定大小的白板。不管輸入多長,成本都一樣。缺點是抓重點的能力變差,而且新資訊只能一直往上疊,疊久了混成一團,該用的時候找不清楚。
DeltaNet 針對這點,寫之前先看那個位置原本放了什麼…
23:55 · 2026年7月28日 · 週二
https://www.threads.com/@dustin_gmat/post/DbUj0BxDybu?xmt=AQG0DiMVofJVCOJ31cUZUNUz076zQwF86mGrLdyJRiMCSvJ7BJr2zzBIR7g0CXEBxjLMmSfU&slof=1
Threads
Dustin GMAT (@dustin_gmat) on Threads
23:12 · 2026年7月28日 · 週二
https://www.instagram.com/reel/DbTduwvCdyw/?igsh=MWp2M242dWJoaTV5eg==
Before
After
Home
Powered by
BroadcastChannel
&
Sepia