-m <path/to/model>
読み込むモデルを指定します。
--host 0.0.0.0 --port 11434
ホストするアドレスとポートです。127.0.0.1にするとローカルエリアには公開されません。
-ngl <整数>
モデルの重みを何レイヤーぶんGPUに乗せるかです。整数とallを指定できます。
-c <整数>
載せるコンテキストウィンドウです。
--temp <実数> --top-p <実数> --top-k <実数> --repeat-penalty <実数>
tempereture, top-p, top-k, repeat-penaltyです。最適な値はだいたいHuggingfaceのモデルのページに記載されています。
--spec-type draft-mtp --spec-draft-n-max 4
MTPを4トークンで有効化します。
-ctk q5_0 -ctv q5_0 -kvu
KVキャッシュをq5_0で量子化し、unified KVを有効化します。
--reasoning-effort <文字列>
reasoning effortを設定します。どういう値で言うことを聞いてくれるかはモデルによります。モデルのページで確認してください。
--jinja
jinjaテンプレートを有効化します。どこから持ってきてるんだ?
--batch-size <整数> --ubatch-size <整数>
prefill時のbatch sizeをソフトとハードの両方から指定します。ubatch-sizeを大きくするとかなりVRAMを食います。
./llama-server -m /media/ubuntu/TIH0528800E/LMStudio-models/unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --port 11434 -ngl all -c 60000 --temp 0.3 --top-p 0.9 --repeat-penalty 1.1 --spec-type draft-mtp --spec-draft-n-max 4 -ctk q5_0 -ctv q5_0 -kvu --reasoning-effort medium --jinja --batch-size 20000 --ubatch-size 2048 --host 0.0.0.0
こんな感じで唱えます。


コメント