Qwen3.8-27Bは素晴らしいが、あまりにもReasoningが長すぎる

ローカルLLM

Qwen3.8-27Bが8/15 0:00にリリースされました。ほぼ同時にUnslothが量子化版を出したのでLMStudioで早速使ってみました。

  • q4量子化、24GB RX 7900 XTXで生成29tokens/s、Prefillは900tokens/sくらい
  • MTP対応
  • 日本語がかなり上達しており、ロールプレイはほぼ完璧
  • tool callしないならReasoningは切ったほうがいい

サイズ感

Q4_K_XL量子化で17GB前後。KVキャッシュをq4量子化して24GBのVRAMから少しはみ出るくらいです。16GBのVRAMで動作するというUnslothの主張は一体何だったんだ……

MTPに対応してはいるが……

LM StudioでMax Draft Tokensを2に設定すると24GBのVRAMからスワップした部分にさらなる重みが加わります。そのせいで結局トークン生成が遅くなり、MTPを無効化すると一番速度を稼げるという結果に……
Draft Tokensの採用率は33%くらいでした。低っ
ただ以下の記事で紹介した通り、学習段階でMTPが使われていると出力の精度が上がるそうなので、もしも学習段階で使われていたら多少遅くなったとしてもMTPを有効化する価値はあります。

追記:HuggingfaceにMTP (Multi-Token Prediction): trained with multiple stepsとあるので、学習段階でMTPを使っていたようです。

MTPは推論速度だけでなくコーディング性能も向上させる
MTP(Multi-token Prediction)による投機的デコーディングは、推論速度の向上だけでなく、コーディングタスクの精度も改善します。HumanEvalで12%、MBPPで17%の向上が報告されており、帰納ヘッドの形成促進や算術の汎化といったメカニズムが性能向上に寄与しています。ただし効果の発現には学習時からのMTP有効化と十分なモデル規模が必要です。

独自の知識問題は完走せず

私はベンチマークテストの汚染を恐れて独自に非公開の知識問題10問をベンチマークテストとして持っています。一般的にReasoningをオンにしてテストすると9問目でハルシネーションを起こし、訂正してはまたハルシネーションを……といった感じで無限ループに陥ります。
そのためReasoningを切ってテストしてみたのですが、この無限ループにはまってしまいました。Reasoningで起きていたことが非Reasoningで起きたのはむしろ感心するべきかもしれません。問題の差し替えを検討しています。

独自のテストを作成すべき理由については以下の記事をご覧ください。

LLMベンチマークテストはハックされている(だから独自のテストを作ろう)
LLMのベンチマークスコアが不当に高くなる原因である「学習データへのテスト混入」や「出題パターンの暗記」の実態を解説します。静的テストの限界を指摘し、モデルの真の実力を測るための「動的テスト」や「独自の非公開テスト」を作成する重要性と具体例を紹介しています。

日本語が上手になった

これまでのQwen-27Bは応答の中で頻繁に簡体字やハングルを混入させていましたが、今のところそういった事態に遭遇していません。文法の理解が進んだのか、プロンプトで口調を指示するだけでほぼ完璧に従ってくれるようになりました。これができるのは他にGemmaくらいでした(Muse Glimmerも上手だが口調が堅すぎる)。
ロールプレイがはかどります。私はこのモデルでPicoclaw(Openclawの超軽量版)を動かすことにしました。うちのPicoclawは東方Projectの火焔猫燐をロールプレイしています。kawaii.

太陽光発電でPicoclawを飼ってみた

目的のない会話をしてしまったとき、指示しなくとも向こうから新しい話題を提案してくれるようになりました。これは新しい。雑談の快適度が上がりましたね。

Reasoningが長すぎる

ずーっとReasoningしていて帰ってきません。ちょっと質問しただけで8分以上も考え込んでしまいます。Reasoningを切っても大して応答の質は変わらないのでできれば切りたいところですが、切ると今度はtool callをしてくれなくなります。困ったもんだ。
このOverthinking傾向は今までもあったのですが、3.8になってから悪化した気がします。Qwen3.8-Maxもそんな傾向があります。Maxの悪口も言いたい。ヘビーユーザーであるがゆえに。あいつ確認もしないで勝手に実装を終わらせてくるんだよ。
Qwen3.8-27BはReasoningしてばっかりでなかなかファイルを編集してくれないという報告があります。私はまだコーディングエージェントとして使っていません。タイミングがなくて……

コメント

タイトルとURLをコピーしました