- WindowsからUbuntuに切り替えるとトークン生成が倍速になる
- Windowsは環境構築の再現性がない
- RadeonだとvLLMは現実的じゃない
- 余談:Windowsは計算に向いていない
Windows : Ubuntu * LM Studio : llama.cpp
Windows+LM StudioからUbuntu+llama.cppに乗り換えたらQwen3.8-27B(UD_Q4_K_XL GGUF)のトークン生成速度が二倍になりました。Ubuntu+LM StudioでもUbuntu+llama.cppより少し遅いくらいの速度(日本語の生成で50tokens/s以上)が出ます(RX 7900 XTX使用)。Windows+llama.cppは環境構築に失敗して動かせませんでした。
UbuntuだとMTPを有効化してQwen3.8-27b-UD_Q4_K_XLを動かして少しくらいスワップさせても前述の速度で動きます。やば。
llama.cppをいきなり触るより、LM StudioのGUIでどういう設定ができるのかを確認してからにしたほうがllama.cppのチューニングが楽です。だいたい同じ設定ができるので。
Windowsは環境構築の再現性がない
Windowsはおま環(お前の環境だけで起きている、の略称。自分の環境でしか再現できない不具合)が多すぎます。公式が用意しているROCmやVulkanのインストール手順に従ってもだいたい失敗します。Linuxなら失敗してもまだ原因がわかりやすく、そもそもそんなに失敗しないんですがね……
あとWindowsでLM Studioを起動するたびに環境変数にPATHが追加されていきます。うざすぎる。
RadeonだとvLLMを使うのは現実的じゃない
vLLMはPaged Attentionのおかげで生成が早いって言いますよね。しかしRadeon(ROCm)環境ではほとんどの量子化形式に対応しておらず、ロードのたびにCPUを1コアだけ使ってsafetensorに変換する処理をするため数分かかります。27BのAWQモデルをロードしたら7分半かかりました。
あとどの環境でもメモリの確保をコマンドラインの引数で手動調節しなければならないのでかなり面倒くさいです。
そもそもWindowsは計算に向いていない
LLMの行列計算に限らず、Windowsに重い計算をさせるのは得策ではありません。たとえばMoneroのマイニングに使うxmrigを走らせたとき、UbuntuでのハッシュレートはWindowsの1.5倍から2倍くらいです。発熱は同じくらい。Wineによる翻訳の手間を考えても、ゲームもlinuxでやったほうがいいかもしれませんね(長く付き合っているWindowsの文句ならいくらでも言える)。
Linuxの些細なデメリット
どうあがいてもCLIの操作を完全になくすことはできません。基本のコマンドだけ検索で知っておいて、あとはドキュメントに従えばいいです。llama.cppもLM Studioでやっていた設定を引数として文字で渡すだけですから、怖がらずにまずやってみましょう。


コメント