← Back to list

使用llama.cpp將HuggingFace模型轉換為GGUF及進行量化-以taide-b.11.0.0模型為例-部署LM-Studio

特別致謝:感謝國科會、國家實驗研究院和 TAIDE 開發團隊的授權使用 以及 PM 許武龍先生(哈爸)的支援服務

Zhan yan jie · 2024-03-15 07:20 · 1 claps · 4.6 min read
#hugginface-modle #gguf #llama-cpp #taide #lm-studio
Open on Medium ↗
Wiki topics: LLM · Large Language Models OPS · LLMOps & Inference

使用llama.cpp將HuggingFace模型轉換為GGUF及進行量化-以taide-b.11.0.0模型為例-部署LM-Studio

特別致謝:感謝國科會、國家實驗研究院和 TAIDE 開發團隊的授權使用 以及 PM 許武龍先生(哈爸)的支援服務

參考網站: 以下是群創的範例

https://medium.com/@NeroHin/將-huggingface-格式模式轉換為-gguf-以inx-text-bailong-instruct-7b-相當於-a2cfdd892cbc

環境:Python 3.10.11

taide-b.11.0.0模型:【目前還不是公開模型】

[embed]art/b.11.0.0 位於 main 我們正在透過開源和開放科學來推動人工智慧並使之民主化。huggingface.co

安裝llama.cpp

git clone https://github.com/ggerganov/llama.cpp.git 
cd llama.cpp 
pip install -rrequirements.txt

測試llama.cpp

python convert.py -h

確認是否轉換程式能否運作

把前面下載好的taide模型例如我這放在【taide-b.11.0.0】資料夾,把資料夾拷貝到llama.cpp目錄路徑下面。

執行轉換

python convert.py taide-b.11.0.0 --outfile taide-b.11.0.0.gguf --outtype f16

轉換中如下圖。

轉換完成

轉換完成

Windows使用llama.cpp量化(quantize)前準備

llama.cpp量化(quantize) 前要先做make。

下載w64devkit-1.21.0並執行w64devkit.exe。

https://github.com/ggerganov/llama.cpp?tab=readme-ov-file#build

cd llama.cpp #到llama.cpp的資料夾
【w64devkit這裏不知道爲啥不能掛載D槽,我先把資料夾放在C槽】。
執行 make

quantize.exe就會生成在llama.cpp的資料夾下。

量化模型:使用 llama.cpp 來進行量化模型

參考網頁建議低成本和保持模型效能使用Q5_K_M,

如果想更節省 RAM,則可以考慮 Q4_K_M。

# 回到windos的命令提示字元CMD下。
# 以q4_k_m 為例
# q4_k_m:提供了不同程度的準確性和推理速度,適合需要平衡資源使用的場景。

cd llama.cpp 
quantize taide-b.11.0.0.gguf taide-b.11.0.0-v0.1-q4_k_m.gguf q4_k_m

結果如下:

處理時間約14分鐘,

模型大小從13GB縮小到4GB。

小結:

以上是將taide-b.11.0.0(HuggingFace)模型轉換為GGUF的實作。另外,使用llama.cpp 進行量化方案q4_k_m,處理時間約14分鐘,模型大小從13GB縮小到4GB。兩個GGUF格式的模型皆可順利部署和執行。

……………………………………………………………………………………………………

部署LM-Studio

我的部署以LM-Studio-0.2.16爲例。

LM-Studio下載:https://lmstudio.ai/

模型路徑的位置要在【\models\Publisher\Repository】下,如下圖。

LM-Studio裏面改變路徑位置到自己的模型所在資料夾。

對話前選擇剛剛載入的模型,如果有GPU可以選擇GPU使用幾層。

彥杰的GPU GTX1660/6GB RAM 6GB,測試最多可以調到13層】

然後就可以開始和模型對話了。

作者:詹彥杰(孫醫師小修)

臺北榮總醫療人工智慧發展中心研究助理 (計畫主持人:孫英洲醫師兼中心副主任)


메타데이터
post_id
366bc4bcb690
slug
將huggingface模型轉換為gguf及使用llama-cpp進行量化-以taide-b-11-0-0模型為例-部署lm-studio-366bc4bcb690
url
https://medium.com/@zhanyanjiework/%E5%B0%87huggingface%E6%A8%A1%E5%9E%8B%E8%BD%89%E6%8F%9B%E7%82%BAgguf%E5%8F%8A%E4%BD%BF%E7%94%A8llama-cpp%E9%80%B2%E8%A1%8C%E9%87%8F%E5%8C%96-%E4%BB%A5taide-b-11-0-0%E6%A8%A1%E5%9E%8B%E7%82%BA%E4%BE%8B-%E9%83%A8%E7%BD%B2lm-studio-366bc4bcb690
canonical_url
https://medium.com/@zhanyanjiework/%E5%B0%87huggingface%E6%A8%A1%E5%9E%8B%E8%BD%89%E6%8F%9B%E7%82%BAgguf%E5%8F%8A%E4%BD%BF%E7%94%A8llama-cpp%E9%80%B2%E8%A1%8C%E9%87%8F%E5%8C%96-%E4%BB%A5taide-b-11-0-0%E6%A8%A1%E5%9E%8B%E7%82%BA%E4%BE%8B-%E9%83%A8%E7%BD%B2lm-studio-366bc4bcb690
author_url
https://medium.com/@zhanyanjiework
status
ok
fetched_at
2026-07-24 06:21:58