
20B〜30B級MoE5モデルガチ比較!Qwen3の無印版だけ「考え中」が漏れ続けた
きっかけ:20B〜30B級のMoE、ちゃんと横並びで見たことがなかった ここまで4B級・12B〜14B級・27B級と見てきたけど、20B〜30B帯——ちょうど「MoE(Mixture of Experts)」構成のモデルが多く出回っているサイズ帯——はまだ横並びで比較していなかった。うちの環境(Ollama+B580×2)には既にいくつかダウンロード済みだったので、5モデルまとめて比較してみた。 対象モデルとテスト内容 モデル 実体 構成 Qwen3-30B-A3B(base) qwen3:30b-a3b MoE(全30B・アクティブ3B) Qwen3-30B-A3B-2507 qwen3:30b-a3b-instruct-2507-q4_K_M MoE(同上、instructチューン版) Gemma4-26B-A4B sonct988/gemma4-26b-a4b-it-q4km-256k MoE(全26B・アクティブ4B) GLM-4.7-Flash-23B-A3B tk2133/GLM-4.7-Flash-REAP-23B-A3B:Q4_K_S MoE(全23B・アクティブ3B) gpt-oss-safeguard-20B gpt-oss-safeguard:20b MoE(20B、セーフティ特化チューン) テスト内容はこれまでと同じ3種(日本語生成・翻訳・コーディング実行)。 生成速度:最速はgpt-oss-safeguard、最遅はGLM gpt-oss-safeguard-20B: 60.1〜60.7 tok/sで圧倒的トップ Gemma4-26B-A4B: 36.7〜43.4 tok/s Qwen3-30B-A3B-2507: 30.9〜31.9 tok/s Qwen3-30B-A3B(base): 28.6〜29.1 tok/s(※後述の理由で参考値) GLM-4.7-Flash-23B-A3B: 16.6〜19.1 tok/sで最も遅い VRAM使用量はGemma4-26B-A4Bが17.9GB、Qwen3-30B系が19.2〜19.3GBで最大、GLMとgpt-oss-safeguardは13.6GBと省メモリだった。 品質チェック:Qwen3-30B-A3B(base)が全タスクで「考え中」を漏らし続けた 今回、一番はっきりした問題が出たのがQwen3-30B-A3B(base、instructチューン前の無印版)。APIリクエストでthink: falseを明示しているにもかかわらず、日本語生成・翻訳・コーディングの全タスクで英語の思考過程がそのまま出力に漏れ続けた。 翻訳タスクでの一部を抜粋すると: 「Okay, let’s tackle this translation request. The user wants the Japanese sentences translated into natural English…(延々と英語での検討が続く)…Okay, I think that’s it. </think> The weather’s great today, so I think I’ll go for a walk in the park.」 ...