2026-08

ローカルLLM

LLMにモデリングさせてみた

3Dモデルを生成してくれるモデルの進化がえげつないのですが、あいつらローポリっぽい見た目でも平気で10万ポリゴンとかのものをお出ししてきます。私がほしいのはローポリのモデル。で、ポリゴンが少なければLLMに頂点ないしはポリゴンの情報を文書と...
ハウツー

AMD GPUでllama.cppを動かす

AMD GPUでllama.cppを動かすならLinux一択。Ubuntu 24.04のインストールからVulkan導入、llama-serverの起動までを解説。ROCmのおま環に悩まされない、一番簡単なローカルLLM環境の構築手順。
ハウツー

llama.cppで必須のコマンド一覧

-m <path/to/model>読み込むモデルを指定します。--host 0.0.0.0 --port 11434ホストするアドレスとポートです。127.0.0.1にするとローカルエリアには公開されません。-ngl <整数>モデルの重み...
ローカルLLM

LLMしたければWindowsを捨てよう

Windows+LM StudioからUbuntu+llama.cppに乗り換えたらQwen3.8-27Bのトークン生成が2倍速くなった(50t/s超・RX 7900 XTX)。vLLMがRadeonで現実的でない理由や、Windowsが計算に向かない根拠まで。
ローカルLLM

Qwen3.8-27Bは素晴らしいが、あまりにもReasoningが長すぎる

Qwen3.8-27BをLM Studioで実測。Unslothのq4量子化(約17GB)はRX 7900 XTX 24GBで生成29 tokens/s。MTPは有効化すると逆に遅く、Reasoningが長すぎて帰ってこない——でも日本語ロールプレイはほぼ完璧だった
ローカルLLM

lfm2.5-2.6bを試す(さすがにqwen3.5-9bには匹敵しない)

lfm2.5-2.6b」を実際に試し、長文読解、コーディング能力、Tool call、日本語の自然さ、ロールプレイ性能を検証したレビュー記事です。qwen3.5-9bやagents-a1-4bと比較しながら、2.6Bクラスの軽量モデルとしての実力と限界を詳しく解説します。