第81回ブログ|【2026年10月版】日本語に強いローカルLLM徹底比較 ─ Qwen3.8・LLM-jp-4.1・Nemotron 3.5の登場で、VRAM帯別の最適解はどう変わったか

2026年10月版 日本語に強いローカルLLM徹底比較

5月の第71回で「日本語に強いローカルLLM」を比較し、7月の第74回で続報をお届けしました。それから2か月で、手元のGPUで動くクラスに有力な新しいモデルが続々と登場しています。Qwen3.8-27B、国産のLLM-jp-4 / 4.1、日本語を公式にサポートするNemotron 3.5 LightningとGranite 4.2などです。ハードウェアでも、128GB以上の統合メモリを積んだマシンが一気に増えました。今回は前回の答え合わせから始めて、2026年10月時点で「どのVRAM帯で、どのモデルを選べばよいか」を、あらためて比較表にまとめてみます。

シリーズ記事

環境構築の手順(Docker + Ollama + Open WebUI など)は第71回から大きく変わっていませんので、そちらをご参照ください。本記事では、モデル選びとハードウェア選びの判断材料に絞ってお話しします。


前回(7月版)の答え合わせ

まずは、第74回でお伝えした見通しが当たっていたかを確認しておきます。外れていた点や不正確だった点は、ここで訂正させてください。

第74回の記述2026年10月時点の事実判定
Kimi K3の重みは7月27日までに公開予定Hugging Faceでmoonshotai/Kimi-K3として公開済み。ただしアクティブパラメータは約50Bではなく約104B(896エキスパート中16を起動)。ライセンスも「Modified MIT」ではなく、独自のKimi K3 Licenseでした公開は的中。規模とライセンスは訂正
Qwen3.7はAPI専用で、オープン版は一世代前Qwen3.7世代はオープンウェイトが出ないまま、8月にQwen3.8世代でオープン版(27Bほか)が公開されました概ね的中
Gemma 4 26B-A4Bが16GB帯の推論の本命総25.2B / アクティブ3.8B、256Kコンテキスト。評価は引き続き高いままです的中
DeepSeek V4はOllama / llama.cppの安定版で未対応llama.cppは6月29日の時点で本体に対応が取り込まれていました(PR #24162)。Ollamaでは8月下旬時点でも、ローカル実行用のタグは確認できていませんllama.cppの部分は誤りでした。訂正します
Ollamaの深刻な脆弱性 CVE-2026-7482GGUF読み込み時のメモリ外読み出し(通称 Bleeding Llama、CVSS 3.1で9.1)。5月4日公表、v0.17.1で修正済み。v0.32以降をお使いであれば影響はありません補足です。「新しい脆弱性」ではなく、すでに修正済みの問題でした

とはいえ、CVE-2026-7482から得られる教訓は今も変わりません。認証のないOllama(ポート11434)を、インターネットから届く場所に公開しないようにしてください。セキュリティ研究者の報告によると、ポートを公開したままのOllamaサーバーは世界に約30万台あるそうです。


この2か月で何が変わったか ─ 3つのポイント

  1. 16〜32GB帯に新しい候補が増えました: Qwen3.8-27B(Apache 2.0)、Nemotron 3.5 Lightning 30B-A3B(日本語を公式サポート)、Granite 4.2(日本語を公式サポート、Apache 2.0)。どれも公式、またはそれに近いGGUFが用意されていて、Ollamaですぐに試せます
  2. 国産オープンモデルでは、LLM-jpが大きく前進しました: 国立情報学研究所(NII)のLLM-jpが、8月にLLM-jp-4 33B、9月28日にLLM-jp-4.1(8B / 32B-A3B / 33B)を公開しています。いずれもApache 2.0で、公式のGGUFもあります。一方、Swallowやほかの国産勢からは、この期間に汎用の新モデルは出ていません
  3. 「128GB以上の統合メモリ機」が現実的な選択肢になりました: 9月にMac Studio(M5 Max / M5 Ultra)が発売され、AMDも最大192GBのRyzen AI Max 400を発表しています。NVIDIAのRTX Sparkも10月に登場する予定です。ただその一方で、GPUとメモリの価格高騰は続いています

日本語性能の現在地 ─ ランキングから見えること

日本語LLMの総合評価としてよく参照されるNejumi Leaderboard 4は、8月に更新されました。Qualitegさんが9月1日に公開した分析記事をもとに、主なスコアを整理してみます(当社ではリーダーボードの元データとの突き合わせまではしていませんので、あくまで目安としてご覧ください)。

区分モデル総合スコア備考
クローズド(首位)Claude Opus 50.872API専用
オープンウェイト最上位Qwen3.8-2.4T-A95B0.860総合3位。ただし2.4兆パラメータのため、ローカルでの実行は現実的ではありません
オープンウェイトKimi K30.843サーバー級(後述)
オープンウェイトQwen3.8-Flash-Next / GLM-5.30.829前者は128GB機で現実的な範囲
国産・日本語強化GPT-OSS-Swallow-120B-RL0.691国産・日本語強化モデルの中で最上位
国産llm-jp-4-33b-thinking0.67624GB帯で動く国産モデル
国産・日本語強化Qwen3-Swallow-8B-RL0.6558B級

ここから読み取れることは、大きく2つあります。

国産モデルには、もう1つ強みがあります。ライセンスがわかりやすく、学習データの情報も公開されていることです。LLM-jpは、事後学習(SFT・DPO)のデータまで公開しています。社内での説明責任や監査を重視する組織にとっては、性能差を補って余りある魅力になるかもしれません。


徹底比較: 手元・自社サーバーで動く主要モデル(2026年10月)

個人のPCから部門のサーバーまでで、現実的に動かせるモデルを一覧にしました。VRAMの目安は、4bit量子化(Q4_K_M相当)で重みが載るかどうかの概算です。コンテキストを長く取ると、KVキャッシュの分だけ必要な量が増える点にご注意ください。

モデル公開構成(総 / アクティブ)コンテキストライセンス日本語VRAM目安(Q4)
LLM-jp-4.1 8B thinking2026/9/28Dense 約8.6B64KApache 2.0◎ 国産・日本語特化8GB
Qwen3 Swallow 8B2026/2Dense 8B─Apache 2.0◎ 日本語強化8GB
Granite 4.2 8B2026/8/25Dense 8B128K(最大512K)Apache 2.0○ 公式に日本語サポート8GB
Gemma 4 12B2026/6/3Dense 12B─Apache 2.0○ 140以上の言語12GB
Gemma 4 26B-A4B─MoE 25.2B / 3.8B256KApache 2.0○16GB
LLM-jp-4.1 32B-A3B thinking2026/9/28MoE 32B / 3B64KApache 2.0◎ 国産・日本語特化16GB+CPUオフロード / 24GB
Qwen3 Swallow 30B-A3B2026/2MoE 30B / 3B─Apache 2.0◎ 日本語強化16GB+CPUオフロード / 24GB
Nemotron 3.5 Lightning 30B-A3B2026/8/11Mamba-2+MoEのハイブリッド 30B / 3B100万OpenMDW-1.1○ 公式に日本語サポート16GB+CPUオフロード / 24GB
Qwen3.8-27B2026/8/14Dense 27B262K(拡張で約100万)Apache 2.0○ 公式の明記はありませんが、Qwen系は日本語での実績があります24GB(Q4で約17GB)
Granite 4.2 30B2026/8/25Dense 30B128K(最大512K)Apache 2.0○ 公式に日本語サポート24GB
LLM-jp-4 33B / 4.1 33B thinking2026/8/18・9/28Dense 約33B64KApache 2.0◎ 国産・日本語特化24GB
Qwen3 Swallow 32B2026/2Dense 32B─Apache 2.0◎ 日本語強化24GB
GPT-OSS Swallow 120B2026/2MoE 120B─Apache 2.0◎ 日本語強化80GB級 / 128GB統合メモリ
Qwen3.8-Flash-Next2026/8MoE 本体125B / 6B(別途埋め込み等あり)262K(最大100万)Qwen Community 1.0○128GB統合メモリ(推定)

※「日本語」欄の◎は、日本語に特化、または日本語を強化したモデルです。○は、モデルカードに日本語の明記があるか、日本語での実績がある系統のモデルです。VRAMの目安は当社の概算で、実測値ではありません。導入の前には、必ずご自身の環境で確認してください。なお、Qwen3 Swallow / GPT-OSS Swallowは、2月公開のv0.2 / RL v0.1が最新です(6月に医療特化版が追加されています)。

注目モデル(1): Qwen3.8-27B ─ 24GB帯の新しい基準

注目モデル(2): LLM-jp-4 / 4.1 ─ 国産オープンモデルの本命

注目モデル(3): Nemotron 3.5 Lightning / Granite 4.2 ─ 「日本語の公式サポート」を明記した海外勢

参考: サーバー級の超巨大MoE(7月以降の動き)

モデル構成ライセンスローカル実行の現実性
Kimi K32.8T / 約104B、100万コンテキストKimi K3 License(独自)llama.cppは8月15日にテキスト対応が取り込まれました。ただし1bit量子化でも約600GBのメモリが必要です
GLM-5.3 / GLM-5.3-Flash753B / Flashは320B・アクティブ約18BGLM-5.3 License / FlashはMITFlashはFP8で約328GB。128GB機では、かなり強い量子化が必要です
DeepSeek V4.1-Flash本体552B、100万コンテキストMITFP8で約510GB。vLLM 0.30が対応しています
Qwen3.8-2.4T-A95B2.4T / 95B独自(Qwen3.8-Max License)大規模なGPUクラスタが前提です

第74回でもお伝えしたとおり、このクラスは「手元で動かすローカルLLM」というより、「自社で占有できる最先端モデル」と考えるのがよさそうです。中国企業製のモデルを業務で使う際の注意点(API利用とローカル実行の区別、独自ライセンスの確認)も、第74回の内容がそのまま当てはまります。


ハードウェアの現在地 ─ 統合メモリ機の台頭と価格高騰

カテゴリ代表製品メモリ動向(2026年9月時点)
コンシューマGPUGeForce RTX 509032GB国内では品薄と価格高騰が続いています。7月には約79万円の製品が即完売したと報じられました。うわさのRTX 50 Superは、GDDR7不足による延期・中止の報道が入り乱れていて、公式発表はまだありません
ワークステーションGPUIntel Arc Pro B7032GB3月発売、米国価格949ドル(8月の実売は1,300ドル前後)。32GB帯では手頃な選択肢です
統合メモリ(Apple)Mac Studio M5 Max / M5 Ultra最大128GB / 最大512GB9月22日発売。M5 Ultraのメモリ帯域は1.2TB/sです。512GB構成の出荷は10月下旬以降になります
統合メモリ(AMD)Ryzen AI Max+ 395 / Ryzen AI Max 400128GB / 最大192GB395搭載の128GBミニPCは2,400〜3,700ドル前後。192GB版の400シリーズ(Gorgon Halo)は、9月のIFAで搭載機が披露されました
統合メモリ(NVIDIA)DGX Spark / RTX Spark128GBDGX Sparkは2月に3,999ドルから4,699ドルへ値上げされました。Windows機のRTX Sparkは10月に登場予定です
据え置きAIワークステーションDGX Station(GB300)大容量8月末からOEM機の出荷が始まりました。価格は10万ドル級です

ここで押さえておきたいのがメモリの価格です。秋葉原の店頭調査(9月24日)では、DDR5-5600の32GB×2枚組が約9万8千円と、2025年春の底値の数倍まで上がっています。第77回でご紹介した「MoEの一部をCPU側のメインメモリへオフロードする」構成はコスト面で有利でしたが、メモリを買い足す負担は半年前よりかなり重くなりました。

そのため、これから機材を購入される場合の考え方も、次のように変わってきています。


ランタイムの更新: Ollama / llama.cpp / vLLM / LM Studio

Ollama(v0.33 → v0.35)

llama.cpp

vLLM(v0.28 → v0.30)

LM Studio(0.4.21 → 0.4.25)


VRAM帯別・2026年10月版のおすすめ

ここまでの内容を踏まえて、第74回のおすすめを更新します。「日本の知識が問われる業務」と「論理・コード・長文処理が中心の業務」とで、モデルの系統を分けるという前回の考え方は、そのまま引き継ぎます。

VRAM / メモリ帯前回(7月)の推薦今回(10月)の推薦
8〜12GBQwen3-8B系、Qwen3 Swallow 8B、Gemma 4 E2B日本語業務: LLM-jp-4.1 8B または Qwen3 Swallow 8B
汎用・画像: Gemma 4 12B(12GB)
長文: Granite 4.2 8B
16GBQwen3 Swallow 30B-A3B または Gemma 4 26B-A4B推論・汎用: Gemma 4 26B-A4B(引き続き本命)
日本語業務: LLM-jp-4.1 32B-A3B / Qwen3 Swallow 30B-A3B(CPUオフロード併用)
24GBQwen3.6 27B / Qwen3 Swallow 32B / Gemma 4 31B汎用・マルチモーダル: Qwen3.8-27B(新しい本命)
日本語業務: LLM-jp-4.1 33B / Qwen3 Swallow 32B
超長文: Nemotron 3.5 Lightning
32GB(RTX 5090 / Arc Pro B70)─24GB帯のモデルを、長いコンテキストで余裕をもって動かせます。RTX 5090ならNemotron 3.5 LightningのNVFP4版も候補
128GB統合メモリ(Mac / Ryzen AI Max / DGX Spark)(サーバー扱い)汎用: Qwen3.8-Flash-Next
日本語業務: GPT-OSS Swallow 120B
サーバー(H100 / H200級)GLM-5.2等の巨大MoEGLM-5.3-Flash(MIT)、DeepSeek V4.1-Flash(MIT)、Kimi K3。運用はvLLM / SGLang

今回いちばん大きな変化は、24GB帯で「汎用ならQwen3.8-27B、日本語業務ならLLM-jp-4.1 33B」と、海外製・国産のどちらにもApache 2.0の有力候補がそろったことです。ライセンスが理由で選択肢が狭まる場面は、ほとんどなくなったと言ってよいと思います。

選ぶ前にやること: 自社タスクで小さく比較する

第74回でもお伝えしましたが、最終的な判断材料になるのは、公開ランキングよりも自社の実際の業務です。Ollamaなら、候補のモデルを並べて同じ質問を投げるだけで、最初の比較ができます。

# 候補モデルを取得(Hugging FaceのGGUFは hf.co/リポジトリ名:量子化 で直接取得できる)
ollama pull nemotron-3.5-lightning
ollama pull hf.co/<GGUFのリポジトリ名>:Q4_K_M

# 同じ業務プロンプトを各モデルに投げて、回答を保存する
for m in nemotron-3.5-lightning hf.co/<GGUFのリポジトリ名>:Q4_K_M; do
  ollama run "$m" "$(cat prompt_社内規程の要約.txt)" > "result_${m//[:\/]/_}.txt"
done

評価用の質問は、実際の業務文書から20〜50問ほど用意すると判断しやすくなります(デジタル庁の「源内」でも、次の調達では評価の設問を50問から300問に増やす予定だと報じられています)。正解のある質問(規程の条文についての質問など)と、文章の自然さを見る質問(お客様向けメールの下書きなど)を混ぜるのがコツです。


国産LLMと制度の動き(8〜9月)

国産LLM各社

デジタル庁「源内」の国産LLM試用

第74回でご紹介した国産7モデルの試用は、当初の想定のように7モデルを一斉に試す形ではなく、段階的に進んでいます。5月には、5社(NTTデータ、ソフトバンク、NEC、富士通、PFN)と評価の契約を結んだと報じられました。7月には、tsuzumi 2・Takane 32B・PLaMo 2.0 Primeの3モデルをさくらインターネットのクラウド上で動かすことが発表されています。国産クラウド上に構築する、初めての政府事例です。9〜11月に既存モデルとのブラインド比較を行い、2027年1月に評価の一部を公表する予定です。なお、9月に比較が実際に始まったかどうかは、公式発表ではまだ確認できていません。

制度の動き


まとめ: 変わったこと、変わらないこと

変わらないこと

変わったこと

5月の第71回から5か月で、比較表の顔ぶれはほとんど入れ替わりました。それでも、選び方の基本は変わりません。ライセンスを確認し、VRAMに載るかを見積もり、自社の業務で試してみることです。モデルが新しいか古いかよりも、この3つを素早く回せる体制があるかどうかが、結果の差につながると私たちは考えています。ローカルLLMの導入や検証でお困りのことがあれば、どうぞお気軽にご相談ください。


参考資料(2026年10月1日時点で確認)

モデル(公式・モデルカード)

ランタイム

ハードウェア

評価・国内動向


本記事は2026年10月1日時点の公開情報に基づきます。VRAMの目安は当社による概算で、各モデルの性能を当社で実測したものではありません。ランキングの数値には第三者の分析記事によるものが含まれます。導入前には各公式情報と自社環境での検証をお願いします。