2026-06

論文紹介

LLMベンチマークテストはハックされている(だから独自のテストを作ろう)

LLMのベンチマークスコアが不当に高くなる原因である「学習データへのテスト混入」や「出題パターンの暗記」の実態を解説します。静的テストの限界を指摘し、モデルの真の実力を測るための「動的テスト」や「独自の非公開テスト」を作成する重要性と具体例を紹介しています。
論文紹介

LLMプロバイダはキャッシュ読み込みのちょっとした改善でかなりの利益を見込める

LLMプロバイダのキャッシュ機能は実は大きなマージンを生み出しうる。論文「Can I Buy Your KV Cache?」をもとに、KVキャッシュをサービス全体で共有することで計算量を最大50倍削減し、料金とのギャップが利益になる仕組みを解説します。
論文紹介

MTPは推論速度だけでなくコーディング性能も向上させる

MTP(Multi-token Prediction)による投機的デコーディングは、推論速度の向上だけでなく、コーディングタスクの精度も改善します。HumanEvalで12%、MBPPで17%の向上が報告されており、帰納ヘッドの形成促進や算術の汎化といったメカニズムが性能向上に寄与しています。ただし効果の発現には学習時からのMTP有効化と十分なモデル規模が必要です。
ローカルLLM

なんかやばい日本語特化モデルが出た(lfm2.5-1.2b-jp-202606)

1.2Bパラメータなのに318トークン/秒、日本語の文章読解もこなすLFM2.5-1.2b-JPをレビュー。Xperia 1 IIIで11t/s動作確認。エッジLLM時代が近づいてる?
ハウツー

(2026年 12~24GB) VRAM別 おすすめローカルLLM比較ガイド

ローカルLLMはVRAMが全て。q4量子化GGUFを前提に、MoEモデルの特性をふまえながら12GB・16GB・24GB別のおすすめモデルを解説。Qwen3.6-27BでのエージェンティックコーディングからGemma4-31Bのロールプレイ性能まで、実運用ベースで比較します。