ローカルLLM

ローカルLLM

LLMにモデリングさせてみた

3Dモデルを生成してくれるモデルの進化がえげつないのですが、あいつらローポリっぽい見た目でも平気で10万ポリゴンとかのものをお出ししてきます。私がほしいのはローポリのモデル。で、ポリゴンが少なければLLMに頂点ないしはポリゴンの情報を文書と...
ハウツー

AMD GPUでllama.cppを動かす

AMD GPUでllama.cppを動かすならLinux一択。Ubuntu 24.04のインストールからVulkan導入、llama-serverの起動までを解説。ROCmのおま環に悩まされない、一番簡単なローカルLLM環境の構築手順。
ハウツー

llama.cppで必須のコマンド一覧

-m <path/to/model>読み込むモデルを指定します。--host 0.0.0.0 --port 11434ホストするアドレスとポートです。127.0.0.1にするとローカルエリアには公開されません。-ngl <整数>モデルの重み...
ローカルLLM

LLMしたければWindowsを捨てよう

Windows+LM StudioからUbuntu+llama.cppに乗り換えたらQwen3.8-27Bのトークン生成が2倍速くなった(50t/s超・RX 7900 XTX)。vLLMがRadeonで現実的でない理由や、Windowsが計算に向かない根拠まで。
ローカルLLM

Qwen3.8-27Bは素晴らしいが、あまりにもReasoningが長すぎる

Qwen3.8-27BをLM Studioで実測。Unslothのq4量子化(約17GB)はRX 7900 XTX 24GBで生成29 tokens/s。MTPは有効化すると逆に遅く、Reasoningが長すぎて帰ってこない——でも日本語ロールプレイはほぼ完璧だった
ローカルLLM

lfm2.5-2.6bを試す(さすがにqwen3.5-9bには匹敵しない)

lfm2.5-2.6b」を実際に試し、長文読解、コーディング能力、Tool call、日本語の自然さ、ロールプレイ性能を検証したレビュー記事です。qwen3.5-9bやagents-a1-4bと比較しながら、2.6Bクラスの軽量モデルとしての実力と限界を詳しく解説します。
ローカルLLM

Agents-A1-4B、想像以上の長文読解力だった

新LLM「Agents-A1-4B」を検証。4Bパラメータながら8万字の長文読解力はQwen3.6-27B並みの実力。一方、コーディングやロールプレイは課題あり。RX 7900 XTXでの動作速度や、エッジデバイスLLMとしての可能性をレポートします。
ローカルLLM

なんかやばい日本語特化モデルが出た(lfm2.5-1.2b-jp-202606)

1.2Bパラメータなのに318トークン/秒、日本語の文章読解もこなすLFM2.5-1.2b-JPをレビュー。Xperia 1 IIIで11t/s動作確認。エッジLLM時代が近づいてる?
ハウツー

(2026年 12~24GB) VRAM別 おすすめローカルLLM比較ガイド

ローカルLLMはVRAMが全て。q4量子化GGUFを前提に、MoEモデルの特性をふまえながら12GB・16GB・24GB別のおすすめモデルを解説。Qwen3.6-27BでのエージェンティックコーディングからGemma4-31Bのロールプレイ性能まで、実運用ベースで比較します。
ローカルLLM

LM StudioがMTPに対応したので使ってみる

LM StudioがMulti Token Prediction(MTP)に対応しました。24GB VRAM環境でQwen3.6シリーズを使い、トークン生成速度の向上幅やVRAM消費、Prefillへの影響を実際に検証した結果をまとめています。一般家庭のスペックではMTPの恩恵は限定的です。