Meta釋出Llama 3.2 1B/3B模型的量化版
支付動態 · 2024-10-25

Meta強調Llama 3.2 1B/3B在經過QAT與SpinQuant方法量化之後,除了大幅減少模型規模與記憶體使用量,同時提高速度、降低功耗,能夠在更多行動裝置上運作

Meta

繼於今年9月開源Llama 3.2的1B與3B模型之後,Meta週四(10/24)釋出了1B與3B模型的量化版,讓模型大小平均減少了56%,記憶體使用量平均減少了41%,模型速度提高了2~4倍,還能降低功耗,以讓這些模型能夠部署到更多的行動裝置上。

Meta說明,他們使用量化感知訓練(Quantization-Aware Training,QAT)與後訓練量化(SpinQuant)兩種方法來量化這兩個模型。前者使用LoRA調節器,於訓練過程中即考慮量化的影響,著重的是模型的準確性,後者則是在模型完成訓練後再進行量化,強調模型的可移植性。

不管是Llama 3.2的1B或3B模型都各自有兩個量化版本,因此總計有4個量化模型,分別是Llama 3.2 1B QLoRA、Llama 3.2 1B SpinQuant,以及Llama 3.2 3B QLoRA與Llama 3.2 3B SpinQuant。

Meta指出,這些量化的模型比非量化(Llama BF16)模型快得多,佔用更少的記憶體,使用更低的功耗,同時還保持與Llama BF16版本幾乎相同的精度。

量化後的Llama 3.2 1B/3B模型儘管只支援8,000個Token的脈絡(原本支援12.8萬個Token),但Meta的評測卻發現,不管是Llama QLoRA或Llama SpinQuant等量化版本的各項基準測試,都與原來的Llama BF16版本相去不遠。

Meta是與合作夥伴共同開發了量化模型,並將這些模型提供給搭載Arm CPU的高通與聯發科的系統單晶片。除了CPU之外,Meta亦計畫透過神經處理單元(NPU)來提升這些量化模型的效能,其合作夥伴已經於開源的行動裝置推論解決方案ExecuTorch上整合了可利用NPU的基礎元件,也正努力於NPU執行這些量化模型。

迄今Meta已於Android OnePlus 12、三星S24+/S22及iOS裝置上測試過這些量化模型,確定它們都可達到相當的準確性。

熱門文章
2027 Global Game Connect(GGC)斯里蘭卡招商全面啟動!業務人脈盡在掌握!
灰度頭條
超級PAC籌資4800萬美元:體育博彩勢力加碼
合規與政策
菲律賓博彩技術賽道迎來新變局,B2B 供應模式加速滲透
東南亞資訊
菲律賓網絡賭博和加密貨幣仍構成持續的洗錢風險
東南亞資訊
越南博彩管控逐步放寬,惟本土需求仍顯乏力
東南亞資訊
新澤西州7月博彩收入創6.06億美元新高,頒布禁令
合規與政策
印第安納州在線賭場法案在眾議院委員會停滯不前
合規與政策
越南在線博彩業政策收緊 催生市場新機遇
東南亞資訊
西班牙監管機構警告在線賭博平臺存在身份盜竊行為
合規與政策
亞洲遊戲市場觀察:15大市場熱門遊戲與用戶趨勢
網路遊戲
英國確認各垂直行業的賭博稅稅率
合規與政策
斯里蘭卡博弈產業大轉型,官方:劍指南亞拉斯維加斯
合規與政策
哈薩克計劃對線上賭場促銷活動進行處罰
合規與政策
巴西擬將博弈稅率提高至24% 稅收將用於社保與醫療領域
合規與政策
JILI 宣佈與全球板球傳奇 AB de Villiers(ABD)達成重磅戰略合作
體育遊戲
首頁
遊戲
合作
發現
我的