論文紹介

論文紹介

LoRAは”手続き”を学習できない なぜエージェントのファインチューニングにFull FTが必要なのか

LoRAファインチューニングは手続き的知識(条件分岐を含む複数ステップの処理)を学習できない──メルボルン大学の研究がSVD解析で証明。rankを上げても改善せず、むしろ悪化する理由と、エージェント開発でフルファインチューンが必要な場面を解説します。
論文紹介

LLMベンチマークテストはハックされている(だから独自のテストを作ろう)

LLMのベンチマークスコアが不当に高くなる原因である「学習データへのテスト混入」や「出題パターンの暗記」の実態を解説します。静的テストの限界を指摘し、モデルの真の実力を測るための「動的テスト」や「独自の非公開テスト」を作成する重要性と具体例を紹介しています。
論文紹介

LLMプロバイダはキャッシュ読み込みのちょっとした改善でかなりの利益を見込める

LLMプロバイダのキャッシュ機能は実は大きなマージンを生み出しうる。論文「Can I Buy Your KV Cache?」をもとに、KVキャッシュをサービス全体で共有することで計算量を最大50倍削減し、料金とのギャップが利益になる仕組みを解説します。
論文紹介

MTPは推論速度だけでなくコーディング性能も向上させる

MTP(Multi-token Prediction)による投機的デコーディングは、推論速度の向上だけでなく、コーディングタスクの精度も改善します。HumanEvalで12%、MBPPで17%の向上が報告されており、帰納ヘッドの形成促進や算術の汎化といったメカニズムが性能向上に寄与しています。ただし効果の発現には学習時からのMTP有効化と十分なモデル規模が必要です。
解説

モデル崩壊とは:AIはAIを食いつぶさない

「AI生成データでAIが劣化する」と言われるモデル崩壊。実は定義が8つに分かれる曖昧な概念で、現実的な訓練条件では致命的崩壊は起きないとする研究もある。ArXiv主要論文をもとに、崩壊の分類・実態・防止策を整理した。
解説

ReasoningがLLMの回答精度を下げることがある

LLMのReasoningは常に精度向上に寄与するわけではありません。事実回答タスクではハルシネーション率が上昇し、小規模モデルほど誤推論が累積します。生成時間が20〜80%増加するのに対し精度向上は3%未満にとどまります。研究に基づいて、いつReasoningを使うべきかを整理します。
ローカルLLM

ローカルLLMのキャラ付けにLoRAは不要。RAGやプロンプトで十分

ローカルLLMでキャラクター再現にLoRAファインチューニングが不向きな理由を解説。口調制御はプロンプトで十分、ドメイン知識の注入にはDoRAやRAGが有効。版権キャラを演じさせる現実的なアプローチを比較検討します。
論文紹介

学習とは忘却である:非可逆圧縮としてのLLM訓練

LLMの訓練は非可逆圧縮である——arXiv論文 Learning is Forgetting を読み解き、モデルが何を残し何を忘れるかが性能を決めるという情報理論的視点を紹介する。