llama.cppで必須のコマンド一覧

ハウツー
-m <path/to/model>

読み込むモデルを指定します。

--host 0.0.0.0 --port 11434

ホストするアドレスとポートです。127.0.0.1にするとローカルエリアには公開されません。

-ngl <整数>

モデルの重みを何レイヤーぶんGPUに乗せるかです。整数とallを指定できます。

-c <整数>

載せるコンテキストウィンドウです。

--temp <実数> --top-p <実数> --top-k <実数> --repeat-penalty <実数>

tempereture, top-p, top-k, repeat-penaltyです。最適な値はだいたいHuggingfaceのモデルのページに記載されています。

--spec-type draft-mtp --spec-draft-n-max 4

MTPを4トークンで有効化します。

-ctk q5_0 -ctv q5_0 -kvu

KVキャッシュをq5_0で量子化し、unified KVを有効化します。

--reasoning-effort <文字列>

reasoning effortを設定します。どういう値で言うことを聞いてくれるかはモデルによります。モデルのページで確認してください。

--jinja

jinjaテンプレートを有効化します。どこから持ってきてるんだ?

--batch-size <整数> --ubatch-size <整数>

prefill時のbatch sizeをソフトとハードの両方から指定します。ubatch-sizeを大きくするとかなりVRAMを食います。

./llama-server -m /media/ubuntu/TIH0528800E/LMStudio-models/unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --port 11434 -ngl all -c 60000 --temp 0.3 --top-p 0.9 --repeat-penalty 1.1 --spec-type draft-mtp --spec-draft-n-max 4 -ctk q5_0 -ctv q5_0 -kvu --reasoning-effort medium --jinja --batch-size 20000 --ubatch-size 2048 --host 0.0.0.0

こんな感じで唱えます。

コメント

タイトルとURLをコピーしました