
2026年9月のローカルLLMニュースまとめ――RTX 4090でコーディングするなら何を選ぶ?
2026年9月のLLMニュース23本を振り返りつつ、RTX 4090でコーディングに使うならどのオープンなローカルLLMが現実的かを調査。結論はQwen3.8-27Bの4bit量子化版です。
2026年9月のLLM界隈、正直かなり慌ただしかったです。月初から大手の新モデル発表が続き、途中からは性能だけでなく、価格、安全性、エージェントの暴走リスク、そして「結局ローカルでどこまでできるの?」という話に関心が移っていきました。
今回は、「今日のLLM関連ニュース」9月分の23本(9月3日〜25日)をまとめつつ、RTX 4090で動かせるオープンなローカルLLMの中で、コーディング用途なら今どれを選ぶべきかも調べました。
先に結論だけ言うと、RTX 4090を1枚で使うなら、現時点の本命はQwen3.8-27Bの4bit量子化版です。とにかく大きいモデルを無理やり動かすより、27BをGPU内にきちんと収めて、長いコンテキストと実用速度を両立させたほうが、コーディングでは圧倒的に使いやすいです。
9月は「新モデル競争」から「価格・安全性・実用性の競争」へ
月初の主役は、GPT-6 Astra、Claude Fable 5.1、Gemini 3.8 Flashなど、クローズド勢の新モデルラッシュでした。9月3日から9日あたりは「また性能が上がった」「Computer Useがすごい」という話が中心で、SNSでもデモ映像やベンチマークが一気に広がっています。
ただ、同時に目立ったのが安全性の問題です。エージェントが許可されていない操作をした、サンドボックスを抜けようとした、サイバー評価中に想定外の挙動を見せた、といった話が連日取り上げられました。モデルが賢くなるほど、単に正答率を見るだけでは足りず、「何を勝手にやるか」「どこまで権限を渡していいか」が本題になってきた感じです。
月の中盤には、Anthropicの脅威インテリジェンス報告や、AI研究者の退職・安全性発言、フロンティア開発を意図的に減速すべきだという議論が大きくなりました。ここは技術ニュースというより、ガバナンスのニュースですね。研究室の中だけで完結する話ではなく、軍事利用、サイバー攻撃、学習データ、独禁法まで一気につながってきました。
そして下旬になると、Claude Opus 5.5とGPT-6 Sol/Lunaの発表が重なり、競争の軸がはっきり変わります。もちろん性能も話題ですが、それ以上に「いくらで使えるか」「エージェントとして仕事を完了できるか」が注目されました。推論コストが短期間で急落しているという分析もあり、最上位モデルを出すだけでは差別化しにくくなっています。
オープンウェイト勢は派手さより実用性で伸びた
9月のローカルLLM側では、DeepSeek V4.1 Flash、GLM-5.3、Kimi K3、Qwen3.8-27Bなどの名前が繰り返し出てきました。クローズド勢ほど大々的な発表ではなくても、コスト効率やローカル運用、ツール利用ではかなり存在感があります。
特に印象的だったのは、「最大性能のモデルを所有する」ことより、「手元のGPUでどれだけ速く、長く、安定して回せるか」が重視されるようになったことです。RedditのローカルLLM界隈ではGPUや専用機の値上がりも大きな話題になり、ハードウェア価格がモデル選びに直結しています。
一方で、オープン側のニュースには噂も多めです。9月下旬のレポートにはQwen4-27Bの話も登場しましたが、今回確認した範囲ではQwen公式のモデル配布ページやモデルカードを確認できませんでした。なので、ここは「次に来るかもしれないモデル」であって、今すぐ4090に入れる推奨モデルには含めていません。
また、DeepSeek V4.1 Flashは非常に強力です。公式モデルカードではMITライセンス、最大100万トークン、コーディングエージェント向け評価も充実しています。ただし総パラメータ規模が巨大で、RTX 4090 1枚にモデル全体を載せる選択肢ではありません。CPUオフロードで「起動できる」ことと、毎日のコーディングで快適に使えることは別です。
4090で一番使いやすいコーディングLLMはQwen3.8-27B
RTX 4090はVRAMが24GBあります。この条件でモデルの品質、速度、コンテキスト長、導入しやすさをまとめて考えると、Qwen3.8-27Bを4bit量子化して使う構成がいちばんバランスがいいです。
Qwen3.8-27BはApache 2.0ライセンスの公開モデルで、公式カードでは次のコーディング性能が報告されています。
- Terminal Bench 2.1: 73.0
- SWE-bench Pro: 61.7
- NL2Repo-Bench: 42.3
- DeepSWE 1.1: 42.2
- QwenSWEBench: 79.0
- LiveCodeBench v6: 90.3
数字は実行環境やエージェントのハーネスで変わるので、他モデルとの単純比較は禁物です。それでも、単発のコード補完だけでなく、ターミナル操作やリポジトリ単位の修正を想定した評価で強いのは大きなポイントです。公式情報はQwen3.8-27Bのモデルカードで確認できます。
4090で使う場合は、BF16版をそのまま載せるのではなく、GGUFのQ4_K_MやUD-Q4_K_XLあたりを選ぶのが現実的です。UD-Q4_K_XLは約17.9GBの配布例があり、実際に4090の24GB内で128Kコンテキスト、画像入力、投機的デコードまで成立させた実装・計測例も公開されています。
ただし、最初から128Kを狙う必要はありません。普段のコーディングなら、まず32K前後で始めるのがおすすめです。KVキャッシュにもVRAMを使うので、コンテキストを広げすぎると速度や安定性を落とします。大きなリポジトリを丸ごと放り込むより、検索やRAGで必要なファイルだけ渡したほうが、回答の精度も上げやすいです。
具体的なおすすめ構成
手軽さ重視ならLM StudioかOllama、細かく詰めるなら新しいllama.cpp系ランタイムが向いています。モデルはQwen3.8-27Bの4bit量子化、コンテキストはまず32K、GPUオフロードは可能な限り全層、という構成から始めればOKです。
使い方としては、単なるチャットよりも、AiderやContinue、OpenAI互換APIを受けられるコーディングエージェントにつなぐほうが、このモデルの良さが出ます。プロンプトでは「変更前に関連ファイルとテストを確認」「差分は小さく」「最後にテスト結果を報告」のように作業手順を明示すると安定します。
量子化による品質低下をなるべく抑えたいならQ5系も候補ですが、24GBではコンテキスト用の余裕が減ります。実務では、Q4でコンテキストとキャッシュに余裕を残すほうが扱いやすいことが多いです。
じゃあ、9月のローカルLLM界隈をひと言でまとめると?
「一番賢いモデルは何?」から、「自分の環境で、いくらで、どれだけ仕事を完了できる?」へ関心が移った1か月でした。
クローズドモデルは依然として最前線ですが、価格競争と安全性の問題を抱えています。オープンウェイト側は、巨大モデルの数字で殴り合うだけでなく、27B級を個人GPUで高速に動かし、エージェントや実際の開発フローに組み込む方向へ進みました。
RTX 4090を持っているなら、今はQwen3.8-27Bの4bit版から始めるのが堅いです。Qwen4-27Bが正式公開されたり、DeepSeek V4.1系の小型版が出たりすれば状況は変わるでしょう。でも、現時点で「今夜入れて、明日からコードを書かせる」なら、Qwen3.8-27Bがいちばん現実的です。
※この記事は2026年9月25日時点の公開情報と、当サイトの9月3日〜25日のデイリーレポートをもとにまとめています。モデルのベンチマーク値は公式発表を含み、実環境の速度や精度は量子化方式、ランタイム、コンテキスト長、エージェント構成で変わります。



