<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>MoE on 現役エンジニアのAI事情</title>
    <link>https://www.engineer-labnote.top/tags/moe/</link>
    <description>Recent content in MoE on 現役エンジニアのAI事情</description>
    <generator>Hugo</generator>
    <language>ja-jp</language>
    <lastBuildDate>Sat, 12 Sep 2026 20:47:27 +0900</lastBuildDate>
    <atom:link href="https://www.engineer-labnote.top/tags/moe/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>20B〜30B級MoE5モデルガチ比較！Qwen3の無印版だけ「考え中」が漏れ続けた</title>
      <link>https://www.engineer-labnote.top/posts/202609122047-20b-30b-kyuu-moe5-moderugachi-hikaku-qwen3-no-mujirushi-han-/</link>
      <pubDate>Sat, 12 Sep 2026 20:47:27 +0900</pubDate>
      <guid>https://www.engineer-labnote.top/posts/202609122047-20b-30b-kyuu-moe5-moderugachi-hikaku-qwen3-no-mujirushi-han-/</guid>
      <description>&lt;img src=&#34;https://i.ibb.co/rK5TZpbs/0a09369b73d6.png&#34; alt=&#34;20B〜30B級MoE5モデルガチ比較！Qwen3の無印版だけ「考え中」が漏れ続けた&#34; style=&#34;width:100%;max-width:720px;height:auto;display:block;margin:0 auto;border-radius:8px;&#34; /&gt;
&lt;h2 id=&#34;きっかけ20b30b級のmoeちゃんと横並びで見たことがなかった&#34;&gt;きっかけ：20B〜30B級のMoE、ちゃんと横並びで見たことがなかった&lt;/h2&gt;
&lt;p&gt;ここまで4B級・12B〜14B級・27B級と見てきたけど、20B〜30B帯——ちょうど「MoE(Mixture of Experts)」構成のモデルが多く出回っているサイズ帯——はまだ横並びで比較していなかった。うちの環境(Ollama+B580×2)には既にいくつかダウンロード済みだったので、5モデルまとめて比較してみた。&lt;/p&gt;
&lt;h2 id=&#34;対象モデルとテスト内容&#34;&gt;対象モデルとテスト内容&lt;/h2&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;モデル&lt;/th&gt;
					&lt;th&gt;実体&lt;/th&gt;
					&lt;th&gt;構成&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-30B-A3B(base)&lt;/td&gt;
					&lt;td&gt;&lt;code&gt;qwen3:30b-a3b&lt;/code&gt;&lt;/td&gt;
					&lt;td&gt;MoE(全30B・アクティブ3B)&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-30B-A3B-2507&lt;/td&gt;
					&lt;td&gt;&lt;code&gt;qwen3:30b-a3b-instruct-2507-q4_K_M&lt;/code&gt;&lt;/td&gt;
					&lt;td&gt;MoE(同上、instructチューン版)&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Gemma4-26B-A4B&lt;/td&gt;
					&lt;td&gt;&lt;code&gt;sonct988/gemma4-26b-a4b-it-q4km-256k&lt;/code&gt;&lt;/td&gt;
					&lt;td&gt;MoE(全26B・アクティブ4B)&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-4.7-Flash-23B-A3B&lt;/td&gt;
					&lt;td&gt;&lt;code&gt;tk2133/GLM-4.7-Flash-REAP-23B-A3B:Q4_K_S&lt;/code&gt;&lt;/td&gt;
					&lt;td&gt;MoE(全23B・アクティブ3B)&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;gpt-oss-safeguard-20B&lt;/td&gt;
					&lt;td&gt;&lt;code&gt;gpt-oss-safeguard:20b&lt;/code&gt;&lt;/td&gt;
					&lt;td&gt;MoE(20B、セーフティ特化チューン)&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;テスト内容はこれまでと同じ3種(日本語生成・翻訳・コーディング実行)。&lt;/p&gt;
&lt;h2 id=&#34;生成速度最速はgpt-oss-safeguard最遅はglm&#34;&gt;生成速度：最速はgpt-oss-safeguard、最遅はGLM&lt;/h2&gt;
&lt;img src=&#34;https://i.ibb.co/hRWM772q/3f5bd131b0be.png&#34; alt=&#34;タスク別生成速度の比較グラフ&#34; style=&#34;width:100%;max-width:720px;height:auto;display:block;margin:0 auto;border-radius:8px;&#34; /&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;gpt-oss-safeguard-20B&lt;/strong&gt;: 60.1〜60.7 tok/sで圧倒的トップ&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Gemma4-26B-A4B&lt;/strong&gt;: 36.7〜43.4 tok/s&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Qwen3-30B-A3B-2507&lt;/strong&gt;: 30.9〜31.9 tok/s&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Qwen3-30B-A3B(base)&lt;/strong&gt;: 28.6〜29.1 tok/s(※後述の理由で参考値)&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GLM-4.7-Flash-23B-A3B&lt;/strong&gt;: 16.6〜19.1 tok/sで最も遅い&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;VRAM使用量はGemma4-26B-A4Bが17.9GB、Qwen3-30B系が19.2〜19.3GBで最大、GLMとgpt-oss-safeguardは13.6GBと省メモリだった。&lt;/p&gt;
&lt;img src=&#34;https://i.ibb.co/tMmQVNBb/3ded65c30ce1.png&#34; alt=&#34;VRAM使用量の比較グラフ&#34; style=&#34;width:100%;max-width:720px;height:auto;display:block;margin:0 auto;border-radius:8px;&#34; /&gt;
&lt;h2 id=&#34;品質チェックqwen3-30b-a3bbaseが全タスクで考え中を漏らし続けた&#34;&gt;品質チェック：Qwen3-30B-A3B(base)が全タスクで「考え中」を漏らし続けた&lt;/h2&gt;
&lt;p&gt;今回、一番はっきりした問題が出たのがQwen3-30B-A3B(base、instructチューン前の無印版)。APIリクエストで&lt;code&gt;think: false&lt;/code&gt;を明示しているにもかかわらず、日本語生成・翻訳・コーディングの&lt;strong&gt;全タスクで英語の思考過程がそのまま出力に漏れ続けた&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;翻訳タスクでの一部を抜粋すると:&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;「Okay, let&amp;rsquo;s tackle this translation request. The user wants the Japanese sentences translated into natural English&amp;hellip;(延々と英語での検討が続く)&amp;hellip;Okay, I think that&amp;rsquo;s it. &lt;code&gt;&amp;lt;/think&amp;gt;&lt;/code&gt; The weather&amp;rsquo;s great today, so I think I&amp;rsquo;ll go for a walk in the park.」&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
