ローカルLLM

LLMにモデリングさせてみた

3Dモデルを生成してくれるモデルの進化がえげつないのですが、あいつらローポリっぽい見た目でも平気で10万ポリゴンとかのものをお出ししてきます。私がほしいのはローポリのモデル。で、ポリゴンが少なければLLMに頂点ないしはポリゴンの情報を文書と...
ハウツー

AMD GPUでllama.cppを動かす

AMD GPUでllama.cppを動かすならLinux一択。Ubuntu 24.04のインストールからVulkan導入、llama-serverの起動までを解説。ROCmのおま環に悩まされない、一番簡単なローカルLLM環境の構築手順。
ハウツー

llama.cppで必須のコマンド一覧

-m <path/to/model>読み込むモデルを指定します。--host 0.0.0.0 --port 11434ホストするアドレスとポートです。127.0.0.1にするとローカルエリアには公開されません。-ngl <整数>モデルの重み...
ローカルLLM

LLMしたければWindowsを捨てよう

Windows+LM StudioからUbuntu+llama.cppに乗り換えたらQwen3.8-27Bのトークン生成が2倍速くなった(50t/s超・RX 7900 XTX)。vLLMがRadeonで現実的でない理由や、Windowsが計算に向かない根拠まで。
ローカルLLM

Qwen3.8-27Bは素晴らしいが、あまりにもReasoningが長すぎる

Qwen3.8-27BをLM Studioで実測。Unslothのq4量子化(約17GB)はRX 7900 XTX 24GBで生成29 tokens/s。MTPは有効化すると逆に遅く、Reasoningが長すぎて帰ってこない——でも日本語ロールプレイはほぼ完璧だった
ローカルLLM

lfm2.5-2.6bを試す(さすがにqwen3.5-9bには匹敵しない)

lfm2.5-2.6b」を実際に試し、長文読解、コーディング能力、Tool call、日本語の自然さ、ロールプレイ性能を検証したレビュー記事です。qwen3.5-9bやagents-a1-4bと比較しながら、2.6Bクラスの軽量モデルとしての実力と限界を詳しく解説します。
論文紹介

LoRAは”手続き”を学習できない なぜエージェントのファインチューニングにFull FTが必要なのか

LoRAファインチューニングは手続き的知識(条件分岐を含む複数ステップの処理)を学習できない──メルボルン大学の研究がSVD解析で証明。rankを上げても改善せず、むしろ悪化する理由と、エージェント開発でフルファインチューンが必要な場面を解説します。
ローカルLLM

Agents-A1-4B、想像以上の長文読解力だった

新LLM「Agents-A1-4B」を検証。4Bパラメータながら8万字の長文読解力はQwen3.6-27B並みの実力。一方、コーディングやロールプレイは課題あり。RX 7900 XTXでの動作速度や、エッジデバイスLLMとしての可能性をレポートします。
論文紹介

LLMベンチマークテストはハックされている(だから独自のテストを作ろう)

LLMのベンチマークスコアが不当に高くなる原因である「学習データへのテスト混入」や「出題パターンの暗記」の実態を解説します。静的テストの限界を指摘し、モデルの真の実力を測るための「動的テスト」や「独自の非公開テスト」を作成する重要性と具体例を紹介しています。
論文紹介

LLMプロバイダはキャッシュ読み込みのちょっとした改善でかなりの利益を見込める

LLMプロバイダのキャッシュ機能は実は大きなマージンを生み出しうる。論文「Can I Buy Your KV Cache?」をもとに、KVキャッシュをサービス全体で共有することで計算量を最大50倍削減し、料金とのギャップが利益になる仕組みを解説します。