Inco AI 發表 Splash,一款專為 Apple Silicon 打造的開源 inference engine。
我剛剛在我的 MBP M5 Max 實測,原本 Qwen 3.8 27B 只能跑到 15 tok/s 而已,改用這套,直接跑到 50 tok/s 耶,超強的啦!👍
兩行命令就可以跑起來,實在是好貼心:
brew install incoai/tap/splash
splash serve --model incoai/Qwen3.8-27B-Splash
它的設計邏輯和主流引擎相反。多數引擎為了通用性而支援各種模型,Splash 則把引擎圍繞單一模型打造。
每個支援的模型都有專屬的 fused kernel、DFlash 2 draft model 與記憶體規劃,runtime 與 API 則共用。
官方在 48 GB 的 M5 Pro 上實測,Qwen3.8-27B 的 decode 速度是次快引擎的兩倍。
從短 prompt 到 32K context 全程領先。四路 subagent 併發時,差距擴大到接近四倍。
Prefill 同樣領先。32K prompt 下,首字等待時間從 317 秒降到 96 秒。
Cache reuse 的差距最大。32K context 命中快取後,首字僅 282 毫秒,約為 oMLX 的 7.3 倍快。
執行環境需要 M3 以上的 Mac、macOS 26.4 以上,以及至少 36 GB 記憶體,官方建議 48 GB。
目前已以 Apache-2.0 開源,更多型號在路上。 👍
https://inco.ai/blog/splash/?fbclid=IwY2xjawUgphFwZG9mAWV4dG4DYWVtAjExAHNydGMGYXBwX2lkEDIyMjAzOTE3ODgyMDA4OTIAAR7EPEYw8kxlepikOVZyhekEM7LNsty_rmvCDgpxlT9Oh-a5oLCusC3CrfLA2g_aem_s8a8lPr4Dcwq2wPfv80ZNw Splash: A Local Engine Built Around the Model
 
 
Back to Top