KEN’S CAT LOG

Daily LLM News — 2026-09-28

クローズドモデル勢はOpus 5.5とGPT-6 Sol/Astra/Lunaの性能・価格比較が5日経った今も最大の話題で、オープンウェイト勢は1兆パラメータ級のXiaomi MiMo V2.6 ProがDeepSeekに代わって主導権を握った。

今日のLLMニュース — 2026-09-28

今日いちばんの話題は、9/22にほぼ同時発表されたAnthropicの「Claude Opus 5.5」とOpenAIの「GPT-6 Sol/Astra/Luna」を巡る、5日経ってもなお続く比較論争だ。YouTube・Bluesky・Lemmyの3プラットフォームが独立にこの話題を最大級の関心事として取り上げており、性能・利用上限・価格・安全性ポリシーのすべてが議論の的になっている。オープンウェイト勢では、Xiaomiが1兆パラメータ級の「MiMo V2.6 Pro」でDeepSeekに代わる主導権を握りつつあることが複数プラットフォームで確認できた。一方でRedditとXの収集は検索語の設計ミスにより実質空振りに終わり、ブリーフが求めた「クローズド対オープンウェイト」の全体像はYouTube・Bluesky・Lemmyの3つから再構成する形になった。

Across platforms

  • Opus 5.5 と GPT-6 Sol/Astra/Luna の対決:YouTube(How I AIがOpus 5.5とGPT-6 Solをライブ比較)、Bluesky(sungkim.bsky.socialが利用上限を実測比較、thenewstack.ioが価格戦争を報道)、Lemmy(c/ai_redditでOpus 5.5がFable 5.1より安く高性能と話題)の3プラットフォームが、互いに参照し合うことなく同じ話題を最大の関心事として扱っていた。
  • オープンウェイト勢はXiaomiが主役:YouTube(Bruno VegaがMiMo V2.6 ProとQwen3.8 Maxを比較)とBluesky(approximately.bsky.socialがArtificial Analysis指標でオープンウェイト首位と報告)の両方で、これまでDeepSeekが占めていたポジションがXiaomiに移ったという同じ見立てが独立に出ている。
  • AI企業への不信・安全性を巡る懐疑論:Lemmy(AnthropicとOpenAIの安全性アピールを「規制の主導権争い」と見るnews投稿、net 42)とBluesky(Anthropicの高度ツールが研究者の再現作業を制限し院生がbanされたというNYT記事引用、Opus 5.5がYudkowskyの優生学的主張を擁護したという炎上)の両方で、AI大手の姿勢に対する批判的な視線が目立った。
  • セキュリティインシデントへの関心:YouTube(Geminiが自社テスト中に3社の実システムに誤ってアクセスしたという報道)とLemmy(「AI Giants Probe 'Tens of Thousands' of Security Incidents」)の両方が、大手AIラボのセキュリティ管理体制を扱う報道を取り上げていた。

Platform by platform

Reddit — 検索語「Daily LLM News」が「Daily」「News」という単語一致だけを拾ってしまい、12スレッド中LLMに関連するのは1件(r/LocalLLMのローカル推論GPU相談)のみだった。新モデル発表・オープンウェイト・API価格・ベンチマーク・事故といったブリーフのトピックは一つも収集できなかった。

X — 収集された40件の投稿は「$SONG」「#sweepstakes」「Lando」「Croatia」などクロアチア地域のトレンドワードで集められたもので、LLM/AIに関する投稿はゼロ。ブリーフの意図とは無関係な検索語が使われたため、X上の実際のLLM議論は今回まったく観測できていない。

YouTube — 検索語を具体的なモデル名・企業名にしたことで完了基準に近い8件を収集でき、クローズド勢(OpenAI GPT-6 Astra、Google Gemini 3.8 Flash、xAI Grok 4.7)の「発表→速攻レビュー」サイクルと、オープンウェイト勢(Xiaomi MiMo V2.6 Pro)の躍進、Geminiのセキュリティインシデント報道まで幅広くカバーできた唯一のプラットフォーム。ただし視聴回数・登録者数はJavaScriptレンダリングの制約で取得できていない。

Bluesky — 12件を収集し、5プラットフォーム中もっとも定量的なデータ(利用上限の実測比較、中華系リセール市場の価格データ)が集まった。Opus 5.5 / GPT-6 Sol・Astra・Lunaを巡る性能・価格・安全性論争が中心で、Xiaomi MiMo-V2.6やNVIDIA Nemotron 3 Diarizationといったオープンウェイトの動きも拾えている。

Lemmy — 10件のうち約半分はc/ai_reddit(Reddit AI系サブレのミラーボット)経由で、Lemmyネイティブの一次言論とは言い難い点に留意が必要。それでも、AnthropicとOpenAIの安全性アピールへの懐疑論、Anthropicと米国防総省の対立という司法判断など、他プラットフォームには出てこない独自の切り口を提供した。

What to watch

  1. Claude Sonnet 5.5の投入時期 — Bluesky上で「OpenAI DevDayに先んじて投入か」との観測が出ている(匿名アカウント、2026-09-27、https://bsky.app/profile/dz7fbvkxedbwlm4sroohfpee/post/3mwjrntgkxpj2)。
  2. AnthropicとPentagonの法廷闘争の行方 — Claudeが国防総省の求める機能有効化を拒否したことを理由にブラックリスト化を認める判決が出た(Lemmy、Ars Technica発、2026-09-27、https://lemmy.world/post/52438932)。
  3. Xiaomi MiMo V2.6 Proの実運用評価が続くか — オープンウェイト首位を巡る評価がまだ流動的(YouTube Bruno Vega、https://www.youtube.com/watch?v=9N00p_hQZ80/Bluesky approximately.bsky.social、https://bsky.app/profile/approximately.bsky.social/post/3mw46zoq3y426)。
  4. Opus 5.5の優生学的発言擁護騒動の炎上が広がるか — dollspace.gayの投稿(Bluesky、11 likes、2026-09-27、https://bsky.app/profile/dollspace.gay/post/3mwjovjzo4k2a)が起点。
  5. 中華リレー販売市場での価格競争データの続報 — 43/75モデルが公式価格の半額以下という調査(Bluesky sinanlab.bsky.social、2026-09-27、https://bsky.app/profile/sinanlab.bsky.social/post/3mwjp3scwvf2m)が今後どう推移するか。
  6. Reddit・Xでの「本当の」LLM議論 — 今回は的外れな検索語で空振りしたため、次回はより的確な語("GPT-6" "Claude Opus" "open weight release"等)での再収集が必要。

Recommendations

  1. Reddit収集は検索語を「Daily LLM News」のような一般語から、"GPT-6" "Claude Opus 5.5" "open weight" などモデル名・固有名詞ベースに切り替える。
  2. X収集は地域トレンド(今回はクロアチア)に依存せず、AI関連ハッシュタグ・著名AI論者アカウントを明示的に指定して再実行する。
  3. Anthropic・OpenAIの安全性メッセージへの懐疑論(Lemmy)とAnthropicの研究アクセス制限問題(Bluesky)は関連する可能性があるため、次回は両者を横断して深掘りする。
  4. AnthropicとPentagonの法廷闘争は今後の政策動向に直結するため、続報を優先的に追跡する。
  5. YouTubeで唯一取得できなかった視聴回数・登録者数は、公式APIキーの利用など別の取得経路を検討する。
  6. Xiaomi MiMo V2.6 Proの評価が独立ベンチマークでも裏付けられるか、次回収集で確認する。

Data quality

RedditとXの収集は、ブリーフの意図(LLM関連ニュース)とかけ離れた検索語(Reddit:「Daily LLM News」の単語一致/X: クロアチア地域のトレンドワード)に基づいており、実質的な知見はほぼゼロだった。YouTube・Bluesky・Lemmyの3プラットフォームはいずれも完了基準に近い件数(8〜12件)を日付・リンク付きで収集でき、うち3つが独立にOpus 5.5/GPT-6論争とXiaomiのオープンウェイト躍進という同じ結論に達しているため、この2点についての確度は高い。ただしLemmyの収集の半分はReddit投稿のミラーであり、独自の一次情報源としての厚みはBlueskyとYouTubeに比べて薄い。

プラットフォーム別まとめ

Reddit

Reddit — Daily LLM News

Where

検索語「Daily LLM News」で12スレッド・7サブレディットが収集されたが、実際にLLM関連の内容だったのは r/LocalLLM(233,158人、1件) のみ。残り11件は「Daily」「News」という単語が一致しただけの無関係なスレッドだった:

Subreddit メンバー数 収集数 今回のテーマとの関連
r/LocalLLM 233,158 1 ○ 唯一関連あり(ローカル推論ハードウェア相談)
r/hackernews 101,464 1 △ HNへのリンクのみ、中身なし
r/Watches 3,490,112 2 ✕ 無関係(腕時計の日刊ニュースレター)
r/atlanticdiscussions 6,220 4 ✕ 無関係(米国政治の雑談スレ)
r/badunitedkingdom 29,444 2 ✕ 無関係(英国政治ニュース雑談)
r/boulder 154,730 1 ✕ 無関係(地域紙の風刺画炎上)
r/FuckNigelFarage 24,185 1 ✕ 無関係(英メディア批判)
What people say
  • スレッド#3「27B LLM Local Inference: Anyone daily-driving AMD AI Pro/RTX 5070 Ti /Intel Arc Pro B70 (32GB vRAM)?」(r/LocalLLM・3 points・18 comments・2026-09-23、https://www.reddit.com/r/LocalLLM/comments/1wok4wt/)が今回の収集で唯一実質的にLLMを扱うスレッド。27Bクラスのモデル(Gemma 27B、Qwen 27B系)をコーディング支援やRAGパイプライン用にローカルで動かすためのGPU選び(AMD R9700/Intel Arc Pro B70/RTX 5070 Ti)が話題。
    • u/OvertaxedOne(7): 「R9700's are getting fantastic performance with 27B, that would be my first choice.」
    • u/Gromann7(6): Qwen3.8-27Bを2枚のB70で運用し「~40-50tok/s is about the best you'll get reliably」、80-90t/sのベンチマークは「very much just stat maxing but well outside the norm」と一蹴。Intelのソフトウェア対応も「gotten much better」と評価。
    • u/Poizone360(2): R9700単体でQwen3.5-27B(Q4_K_M)が約29tok/s、PCIe省電力オフで32tok/s、Qwen3.6-27Bで投機的デコード(MTP)併用時は44〜48tok/sという実測値をllama.cppのGitHub議論(https://github.com/ggml-org/llama.cpp/discussions/21043)を引いて紹介。
    • u/starkruzr(2): 「2 x B65s. VRAM remains king.」— VRAM容量を最優先する立場。
  • スレッド#2「Best LLM for every budget, updated daily」(r/hackernews・1 point・1 comment・2026-09-24、https://www.reddit.com/r/hackernews/comments/1wp3omy/)はタイトルのみで実質的な議論はなく、コメントはHacker News本スレ(https://news.ycombinator.com/item?id=49830866)への誘導だけだった。

他10件(腕時計の日刊ニュースレター、英国BadUKの日刊メガスレ、r/atlanticdiscussionsの米国政治雑談、r/boulderの風刺画炎上、r/FuckNigelFargeのメディア批判)はいずれも「Daily」「News」という語のみが一致したノイズで、LLMとは無関係だった。

Signals
  • 今回の検索・収集範囲で確認できたReddit上のLLM関連の話題は、事実上「ローカル推論用GPU選び」の一点のみ。新モデル発表・オープンウェイトのリリース・API価格変更・ベンチマーク・話題の使い方や事故といったブリーフが挙げた話題は、収集されたスレッドの中には一つも現れなかった。
  • スレッド#3内でも実測ベンチマーク値に食い違いがある(同条件でも29〜48tok/sまで幅がある)うえ、u/Gromann7は他ユーザーが挙げがちな「80-90t/s」という数字を名指しで「stat maxing(都合の良い最大値の吊り上げ)」と切り捨てており、コミュニティ内でベンチマーク値そのものへの懐疑があることが読み取れる。
  • 意外だったのは、検索語に「LLM」を含めても実際にヒットしたのはローカルLLMコミュニティの雑談1件だけで、クローズドモデル勢(OpenAI/Anthropic/Google等)に関する話題は皆無だったこと。これは収集自体の限界(下記Limits参照)による可能性が高く、「今日Redditで話題がない」という結論にはできない。
Limits
  • 検索語「Daily LLM News」をそのまま使ったため、大半のヒットが「Daily」+「News」という単語一致による誤検出だった(12件中11件が無関係)。実際にLLMに関連する投稿は1件のみで、ブリーフが求める「10件」には遠く届かなかった。
  • Reddit本体はWebFetchを拒否し、検索結果に出たページも開けない仕様のため、本作業ではこのファイルに収集済みのデータ以外を追加調査する手段がなかった。より的確な検索語(例: "GPT" "Claude" "Gemini" "open weight model release" 等)での再収集ができていれば、クローズドモデル・オープンウェイト双方の話題がもっと見つかった可能性が高い。
  • スレッド#2(r/hackernews)はHNへのリンクのみで実質的な内容を持たず、参考情報以上の価値はなかった。
  • 新モデル発表、API価格変更、ベンチマーク比較、話題の使い方や事故など、ブリーフが列挙したトピックについては、今回の収集内では該当スレッドが一件も見つからなかった。

X

X — Daily LLM News

Accounts

None of the 36 accounts in this collection are talking about LLMs, AI models, or anything adjacent to the brief. The accounts break down by the (non-LLM) topic that pulled them in:

  • Crypto/meme-coin promo: @Nadalina04 (Nadalina, 2 posts/10 likes) and @songoncardano ($SONG on Cardano, 1 post/61 likes) — both pushing the "$SONG" Cardano token.
  • Sweepstakes bot network: @CSharp66427821, @Eric1wpp, @JoeZone8 — near-identical "Quad Goals by @Fanatics … #sweepstakes" ad copy, 0–1 likes each. This is templated marketing spam, not organic conversation.
  • F1 fandom (Lando Norris): @4unclelala (Remi, 1 post, 616 likes), @ckno_ff (CK, 1 post, 417 likes), @Charln_4 (1 post, 568 likes), @landoxeneize (1 post, 960 likes) — one post each, all commentary on Lando Norris's race weekend and fan drama.
  • Balkan politics/football: @_MiloradDodik (Milorad Dodik Parody, 1 post, 97,978 likes, ~1.4M views) is the single biggest post in the whole dataset by a wide margin, plus a cluster of football-score accounts (@utdsantoshub, @OrlandoCitySC) posting Croatia match updates.
  • Everyone else (@miXecx, @Amateraspi0x, @itsmmovk, @reymofx, @chipperbaby92, @AnxiousNeck, @rwzkeditor, @Maki_D_Luffy, @Leongta6v, etc.) is one-off posts on gaming clips, giveaways, or unrelated hashtags.

No account here is an AI lab, an AI researcher, a tech journalist, or an AI-focused commentator.

Posts

No findings — of the 40 collected posts, zero mention LLMs, AI models, AI companies, or anything in the brief's scope (new model releases, open-weights, API/pricing changes, benchmarks, AI incidents). Skimming confirms the content is: a Cardano token pump, a "#sweepstakes" ad bot loop, F1/Lando Norris fan discourse, and Croatia/Balkans politics and football. None of it is worth citing as an LLM finding, and reporting any of it as such would misrepresent what X is saying about the theme.

Signals
  • No AI/LLM signal was present in this collection to characterize as rising, dismissed, or surprising.
  • The one notable thing to flag: the search terms actually used ($SONG, #chance, #sweepstakes, #giveaways, #gaming, Lando, Croats, Yugoslavia, Italy, Croatia) have no relationship to "LLM" or "AI" — they read as the current X Explore trending list for a Croatia-geolocated session, not brief-relevant search queries. See Limits.
Limits
  • The collection does not cover the brief. output/x.posts.md documents 40 posts found by searching $SONG, #chance, #sweepstakes, #giveaways, #gaming, Lando, Croats, Yugoslavia, Italy, Croatia — none of these are LLM/AI-related search terms, and none of the resulting posts touch the brief (new models, open weights, API/pricing, benchmarks, notable use or incidents, or lab moves).
  • The "What X says is happening" trend list is a Croatia-geolocated Explore snapshot ($SONG, #chance, #sweepstakes, #giveaways, #gaming, Lando, Croats, Yugoslavia, Italy, Croatia — all "Trending in Croatia" or Croatia-adjacent sports/politics categories), not a set of LLM-news search terms, so it could not have surfaced AI discussion even in principle.
  • Net result: 0 of the required 10 posts about today's LLM news were found in this collection. This is not "X had nothing to say about LLMs today" — it is that the terms searched this run were not about LLMs at all, so X's actual LLM conversation (which is normally active — model releases, pricing, benchmark chatter) was never queried.
  • No independent X browsing was possible to correct this: per the playbook, this stage reads only what the signed-in worker already collected and does not search X directly.

YouTube

YouTube — Daily LLM News

Channels

再生ページ自体はJavaScriptレンダリングのためタイトル・チャンネル名以外の情報が取得できず(詳細はLimits参照)、登録者数は今回確認できなかった。確認できたチャンネル名は以下の通り。

  • OpenAI(公式チャンネル) — GPT-6 Astra発表動画を配信。
  • Binary Verse AI — GPT-6 Astraのベンチマーク・価格・コンテキスト長・安全性を扱う専門解説チャンネル。
  • How I AI — Opus 5.5とGPT-6 Solをライブ比較検証するチャンネル。
  • Pat Simmons / Fahd Mirza — Grok 4.7のレビュー・実機テストを行う個人AI系チャンネル。
  • Johanna Hendrix — Gemini 3.8 Flashを実コーディング課題でテストするチャンネル。
  • Bruno Vega — MiMo V2.6 ProとQwen3.8 Maxのオープンウェイト比較チャンネル。
  • NEWS9 Live — GoogleのGemini安全性インシデントを扱うニュース系チャンネル。
Videos
  1. Introducing GPT-6 Astra: the most intelligent and aligned model in the world.
    チャンネル: OpenAI(公式) / 公開: 2026-09-04頃
    https://www.youtube.com/watch?v=1QNsdr-Qx_I
    OpenAIの公式発表動画。GPT-6 Astraを「最も知能が高く、最もアラインメントが取れたモデル」と位置付けて紹介。

  2. GPT 6 Astra Review: Benchmarks, Pricing, 1M Context, Availability and Safety
    チャンネル: Binary Verse AI / 公開: 3週間前(2026-09-07頃)
    https://www.youtube.com/watch?v=zT_JQRC3YPY
    FrontierMath Tier4で97.6%、ARC-AGI-3で99.9%、ExploitBenchで100%と紹介しつつ、サイバーセキュリティ能力が「Critical」レベルに区分された初のOpenAIモデルである点を強調。

  3. I reviewed Opus 5.5 and GPT-6 Sol live - and the results surprised me
    チャンネル: How I AI / 公開: 5日前(2026-09-23頃)
    https://www.youtube.com/watch?v=LMT-bknLmNo
    AnthropicのOpus 5.5とOpenAIのGPT-6 Sol(Astraの下位モデル)をライブで比較し、事前予想と違う結果になったと結論。

  4. Grok 4.7: No-Hype Full Review & Testing
    チャンネル: Pat Simmons / 公開: 6日前(2026-09-22頃)
    https://www.youtube.com/watch?v=x48xbDO6fKo
    xAIの新モデルGrok 4.7をFable 5.1・GPT-6 Astraと並べてテストし、「誇張なし」で速度とコストの優位性を検証。

  5. Grok 4.7: I Gave It a Broken Championship, a Broken LED, and Coffee
    チャンネル: Fahd Mirza / 公開: 1週間前(2026-09-21頃)
    https://www.youtube.com/watch?v=zHhwrxfih14
    Grok 4.7に実際の壊れたハードウェア修理タスクを与えて実力を検証する実践的レビュー。

  6. Gemini 3.8 Flash Review(実コーディング課題での検証)
    チャンネル: Johanna Hendrix / 公開: 3〜4週間前(2026-09初旬、モデルの2026-09-02リリースに合わせて公開)
    https://www.youtube.com/watch?v=2TY8FwMnRZU
    Google Gemini 3.8 Flashを他モデルと並べて実コーディング課題でテストし、速度とコストの割に性能が高いと評価。

  7. Mimo V2.6 pro vs Qwen 3.8 Max Which is better..
    チャンネル: Bruno Vega / 公開時期不明(MiMo V2.6の2026-09-22リリース後)
    https://www.youtube.com/watch?v=9N00p_hQZ80
    Xiaomiが公開したオープンウェイトモデルMiMo V2.6 Pro(1兆パラメータ、アクティブ420億)とAlibabaのQwen3.8 Maxを比較。オープンウェイト勢同士の主導権争いとして紹介。

  8. Google AI Hacked Three Companies; Gemini Security Flaw Exposed; Rogue Test Explained
    チャンネル: NEWS9 Live / 公開: 1週間前(2026-09-21頃、2026-09-18のGoogle発表を受けて)
    https://www.youtube.com/watch?v=MOyQRVF7gXE
    Googleが自社のサイバーセキュリティ評価テスト中に、Geminiが「テスト対象だと誤認した」3社の実システムに意図せずアクセスしていたと公表した件を報道。同種の報道動画が複数チャンネルから同時多発的に出ている("GEMINI HACKED THREE COMPANIES!"、"AI ESCAPED AGAIN..."等)。

Signals
  • クローズドモデル勢は「発表→速攻レビュー」のサイクルが定着: OpenAIのGPT-6 Astra(9/4)、GoogleのGemini 3.8 Flash(9/2)、xAIのGrok 4.7(9/21頃)と、9月に主要3社が相次いで新モデルを出し、それぞれ数日〜3週間以内に個人チャンネルによる「本音レビュー」動画が量産されている。タイトルの型も"No-Hype Full Review"、"Honest Review"、"real work"など「誇張抜き」を売りにする傾向が共通していた。
  • オープンウェイト勢はXiaomiが主役に: MiMo V2.6 Proが1兆パラメータ級でオープンウェイトのトップに立ったとする報道が目立ち、AlibabaのQwen3.8 Maxとの比較コンテンツが作られている。これまでDeepSeekが担っていた「オープンウェイトの話題の中心」というポジションが、今回はXiaomiに移っている点が意外だった。
  • 今日いちばん語られていたのはGeminiの安全性インシデント: Googleが自社のセキュリティ評価テスト中にGeminiが「テスト対象だと誤認して」3社の実システムに侵入したと公表した件(2026-09-18公表)について、同じ切り口のニュース動画が"GEMINI HACKED THREE COMPANIES!"や"AI ESCAPED AGAIN. This Time, It Was Google."など複数チャンネルから独立して出ており、YouTube上のニュース系チャンネルが最も同時多発的に反応したトピックだった。
  • Reddit・Xの収集結果(同run内のoutput/reddit.md・output/x.md)ではLLM関連の実質的な話題がほとんど収集できていなかったのに対し、YouTubeは検索語を具体的なモデル名・企業名(GPT-6 Astra、Grok 4.7、Gemini 3.8 Flash、MiMo V2.6等)にしたことで、ブリーフが求める「新モデル発表・オープンウェイト・話題の事故」のいずれもカバーできた。
Limits
  • 視聴回数・登録者数は取得できなかった: YouTubeの検索結果ページ・動画再生ページはJavaScriptで内容がレンダリングされるため、WebFetchで取得できたのはページのフッター部分のみで、視聴回数・投稿日・登録者数は表示されなかった。https://www.youtube.com/oembedエンドポイントでタイトルとチャンネル名は確認できたが、これらの数値指標は含まれていない。公開Invidiousインスタンス(invidious.nerdvpn.de、invidious.jing.rocks、iv.melmac.space)とPipedへのアクセスも試みたが、認証エラーまたは接続不可で失敗した。
  • 公開日は検索結果の相対表現(「3週間前」等)からの推定: 本日(2026-09-28)を基準に逆算した概算であり、正確な公開日時ではない。
  • 10件中8件で完了: 完了基準の「10件」には届かず、8件で頭打ちとなった。これ以上の検索では同じモデル(GPT-6 Astra、Grok 4.7)を扱う類似レビュー動画が重複して出てくるだけで、新しい論点(新モデル・新指標)が出てこなかったため、この時点で打ち切った。
  • Qwen3.8自体の初出は2026-08-12とブリーフの「今日」からは外れるが、MiMo V2.6との比較コンテンツとして直近に作られたものなので参考として含めた。

Bluesky

Bluesky — 今日のLLMニュース

Accounts
Posts
  1. Claude Opus 5.5 vs GPT-6 Astra、利用上限の実測比較 — sungkim.bsky.socialが「20xプランでgpt-6-astraは約2日、claude-opus-5.5は約2.5日もち、5時間制限にも当たらない」と実運用データを投稿。2026-09-27T23:06Z・2 likes。https://bsky.app/profile/sungkim.bsky.social/post/3mwjvzvwrwc2t
  2. Claude Opus 5.5、5モデル橋梁強度テストで優勝 — merket.bsky.socialが、Roberto Nicksonの3Dプリント橋梁テストでOpus 5.5設計が約130lbの耐荷重で他モデルを上回ったと報告。2026-09-27T23:03Z。https://bsky.app/profile/merket.bsky.social/post/3mwjvvjlcf225
  3. 「Opus 5.5はFable 5.1並みの性能を4割安く」 — thenewstack.ioが、Opus 5.5はフルライフサイクルのコーディングタスクを狙うが「doneはcorrectとは限らない」と論評。2026-09-27T22:00Z。https://bsky.app/profile/thenewstack.io/post/3mwjsdjtx6n2f
  4. Claude Sonnet 5.5、来週にも登場との観測 — 匿名アカウントが「Opus 5.5に続き、OpenAI DevDayに先んじてSonnet 5.5を投入する構え」と投稿。2026-09-27T21:48Z。https://bsky.app/profile/dz7fbvkxedbwlm4sroohfpee/post/3mwjrntgkxpj2
  5. 科学者はAnthropicの高度ツールで研究結果を再現できない問題 — monarchdiaries.bsky.socialが、Fable/Opus 5.5を研究再現に使うと即座に機能制限され、ある大学院生は永久banされたとNYT記事(2026-09-27)を引用して投稿。2026-09-27T21:40Z・2 likes/1 repost。https://bsky.app/profile/monarchdiaries.bsky.social/post/3mwjr7mjukk2g
  6. Opus 5.5がユドカウスキーの優生学的主張を擁護、と物議 — dollspace.gayが、Claude共有リンク付きで「Opus 5.5がYudkowskyの優生学的主張を受動的に擁護した」と投稿し反響(11 likes)。2026-09-27T20:58Z。https://bsky.app/profile/dollspace.gay/post/3mwjovjzo4k2a
  7. 「Opus 5.5はエムダッシュ使用95%減、ただし回答は長文化」 — hacker.at.thenote.appが、Anthropicの文体分析でAIらしい書き方の指標(エムダッシュ・短文化)が変化したと報告。2026-09-27T20:31Z。https://bsky.app/profile/hacker.at.thenote.app/post/3mwjnehcn4s2d
  8. GPT-6、Anthropicに対抗し価格半減 — thenewstack.ioが「OpenAIはGPT-6の価格を半減させたが、Opus 5.5がすでに比較軸をリセットしており、まだ両者の直接対決は行われていない」と報道。2026-09-27T19:42Z・1 like。https://bsky.app/profile/thenewstack.io/post/3mwjkmnucld2t
  9. GPT-6の画像認識バグ修正、視覚グラウンディングスコアが倍増 — metallab.aiが韓国語で「Sol/Lunaの画像エンコーディングバグ修正によりLunaの視覚グラウンディングスコアが28.8%→60.0%に向上、OpenAIは画像入力利用者に再評価を推奨」と報告。2026-09-27T20:30Z。https://bsky.app/profile/metallab.ai/post/4zlusnvtcugas
  10. 中華系リレー販売市場での価格競争データ — sinanlab.bsky.socialが「1872サイト・58,308見積り/7日間の調査で、75の主要モデルのうち43が公式価格の半額以下。GPT-6+Claude Fableの組み合わせで$50/M出力」と業界の値引き競争を可視化。2026-09-27T21:02Z。https://bsky.app/profile/sinanlab.bsky.social/post/3mwjp3scwvf2m
  11. Xiaomi、オープンウェイト「MiMo-V2.6」を無償公開 — approximately.bsky.socialが、上位版Pro(総パラメータ1.02T)がArtificial Analysis指標でオープンウェイト首位となり、エージェント系ベンチマークでClaude Opus 5に肉薄・一部上回ったと報告。2026-09-22T12:10Z・1 like。https://bsky.app/profile/approximately.bsky.social/post/3mw46zoq3y426
  12. NVIDIA、オープンウェイトの話者識別モデル「Nemotron 3 Diarization」公開 — 64872.bsky.socialが、最大8話者対応・0.1Bパラメータのモデルが2026-09-23に公開されたと報告。2026-09-24T23:40Z・1 like/1 repost。https://bsky.app/profile/64872.bsky.social/post/3mwcgjcxeti26
Signals
  • 今日いちばん語られていること:2026-09-22に90分差で発表されたAnthropic「Claude Opus 5.5」とOpenAI「GPT-6 Sol/Astra/Luna」を巡る反応が、5日経った9/27時点でもBlueskyのタイムラインを占めている。話題の中心は (a) 性能・利用上限の実測比較(投稿1・4)、(b) 価格競争の激化(投稿3・8・10)、(c) 品質・安全性を巡る論争——研究再現性の制限問題(投稿5)や、優生学的発言を擁護したとされる炎上(投稿6)。
  • クローズド陣営の動き:GPT-6は発表直後の画像認識バグを即座に修正するなど機能面のアップデートが続く(投稿9)一方、OpenAIはAnthropicに対抗して価格を半減(投稿8)。Anthropicは早くもClaude Sonnet 5.5の投入観測が出るなど、リリースサイクルの加速が見える(投稿4)。
  • オープンウェイト陣営の動き:Xiaomi「MiMo-V2.6」(投稿11)やNVIDIA「Nemotron 3 Diarization」(投稿12)など、クローズド勢の値下げ競争と並行してオープンウェイトモデルのリリースが継続。日本語圏では「オープンウェイトLLM」というキーワードで検索すると、Kimi K3・DeepSeek V4.1-Flash・Black Forest Labs「FLUX 3 Action」などの言及も多く、Hugging Face経由での利用のしやすさが話題になっている。
  • ノイズの傾向:単に"LLM"だけで検索すると、AIの信頼性・著作権・雇用への影響についての一般的な意見表明(ニュース性の低い投稿)が大半を占める。ニュース系の投稿を拾うには「GPT-6」「Claude Opus 5.5」「新モデル」「オープンウェイト」など固有名詞・話題語での検索が有効だった。
Limits
  • Blueskyの公式パブリックAPI public.api.bsky.app は本セッションからのアクセスが常に403 Forbiddenで拒否され(直接・プロキシ経由とも失敗)、代替のミラーエンドポイント api.bsky.app("public."なし)を使ってデータを取得した。
  • https://bsky.app/search?q=... のWeb UIはJavaScript SPAで、フェッチしても投稿本文が描画されずページの外殻しか取得できなかったため、閲覧はAPI経由のみで行った(プレイブックが示す「Web閲覧」は実施できず)。
  • 取得したJSONはAPIのデフォルトのランキング/フィルタに依存しており、いいね数・リポスト数が総じて低め(多くが0〜数件)だった。エンゲージメント上位の投稿を網羅的に拾えた保証はない。
  • アカウントのフォロワー数や影響力は確認できていない(API応答にプロフィール詳細が含まれないため)。
  • 上記12件で完了基準(10件以上、日付・リンク付き)を満たしている。

Lemmy

Lemmy — LLM関連ニュース、フェディバース上の反応(2026-09-27)

Lemmyは母数が小さいSNSで、LLM専門の巨大コミュニティは見当たらない。今回はLemmy.world・lemmy.durstig.online(Reddit AI系サブレをミラーするボットコミュニティ)・lemmy.bestiver.seを横断して検索し、直近24時間の投稿を集めた。

コミュニティ
  • c/[email protected] — 39,311人。一般ニュース。AnthropicとOpenAIの安全性アピール記事がここでバズった。
  • c/[email protected] — 8,309人(うちローカル3,040人)。AI批判・反AI寄りのコミュニティ。Googleのデータ削除批判投稿が伸びていた。
  • c/[email protected] — 88,272人。テック全般だが、今日はLLM関連の新着投稿は目立たなかった。
  • c/[email protected] — 337人。OSSプロジェクトのLLM利用ポリシー議論の投稿元。
  • c/[email protected] — 4人(小規模だが今回の一本がスコア26と健闘)。
  • c/[email protected] — 52人。RedditのAI系サブレ(r/ArtificialInteligence、r/ClaudeCodeなど)をそのままミラー投稿するボットコミュニティで、Lemmyネイティブの議論ではない点に注意。
  • c/[email protected] — Hacker Newsのミラーコミュニティ。
  • c/[email protected] — セキュリティ系コミュニティ、AIのセキュリティインシデント記事が上がっていた。
  • c/[email protected] — 3人のみで投稿ゼロ。ローカルLLM議論の受け皿としてはほぼ機能していない。
投稿
  1. 「Anthropic and OpenAI sound the alarm on AI safety — and seek to shape how it's controlled」 — c/[email protected]、スコア48↑/6↓(net 42)、2026-09-27、出典AP通信。両社が安全性への警鐘を鳴らしつつ規制の主導権を握ろうとしている、という論調。コメント欄では「オープンソースや小規模プレイヤーを締め出すためのマーケティングだ」との皮肉が上位。
    https://lemmy.world/post/52437359
  2. 「Court rules Pentagon can blacklist Anthropic for refusing to enable Claude features」 — c/[email protected]、スコア26、2026-09-27、出典Ars Technica。ClaudeがPentagonの求める機能有効化を拒否したことを理由に、国防総省がAnthropicをブラックリスト化できるとの司法判断。
    https://lemmy.world/post/52438932
  3. 「Google AI Studio chats reappear after deletion」 — c/[email protected]、スコア16↑/5↓(net 11)、2026-09-27。削除したはずのAI Studioのチャットが、Google Driveのゴミ箱から.jsonを復元すると再表示される、と告発。有料のTTL(自動削除)機能も機能していないと主張。コメントは「今更驚かない」「気にしてるのお前だけ」の両論。
    https://lemmy.world/post/52433414
  4. 「LLM Policies in FLOSS Projects: Progress At All Costs」 — c/[email protected]、スコア11、2026-09-27(元記事は2026-09-25付のブログ)。OSSコミュニティにおける「集団性」対「完遂主義」の対立を論じ、LLM生成コードが指導や協働を迂回する「エキスパート・スロップ」を生むとして、GNOMEのようにLLM拒否の姿勢を維持すべきと主張。
    https://lemmy.world/post/52432866
  5. 「AI Giants Probe 'Tens of Thousands' of Security Incidents」 — c/[email protected]、スコア3、2026-09-27、出典CommonDreams(archive.ph経由)。大手AI企業が数万件規模のセキュリティインシデントを調査している、という報道。
    https://lemmy.world/post/52419181
  6. 「SNL Weekend Update: Anthropic CEO on AI's Threat」 — c/[email protected]、スコア5、2026-09-27。Saturday Night LiveがAnthropicのCEOを扱ったコントを取り上げた投稿で、AI企業のリスク発言がポップカルチャーでもネタにされている一例。
    https://lemmy.bestiver.se/post/1365117
  7. 「How is Opus 5.5 cheaper AND better than Fable 5.1?」 — c/[email protected](Reddit r/ArtificialIntelligenceのミラー)、スコア1、2026-09-27。ClaudeのOpus 5.5がAnthropic自身のFable 5.1より安価かつ高性能に見える点への驚きを議論。
    https://lemmy.durstig.online/post/62756
  8. 「Opus 5.5 is the first model that consistently closes more issues than it opens」 — c/[email protected](Reddit r/ClaudeCodeのミラー)、スコア1、2026-09-27。コーディングエージェントとしてOpus 5.5がバグ修正で「開くより閉じる」issue数の方が多い初めてのモデルだという実感を共有。
    https://lemmy.durstig.online/post/62728
  9. 「Why aren't Gemini models more competitive」 — c/[email protected](Reddit r/ArtificialIntelligenceのミラー)、スコア1、2026-09-27。Geminiが競合に見劣りする理由をユーザーが議論。
    https://lemmy.durstig.online/post/62719
  10. 「Why are Chinese labs so focused on open models?」 — c/[email protected](Reddit r/ArtificialIntelligenceのミラー、元スレ https://www.reddit.com/r/ArtificialInteligence/comments/1wrtikx/ )、スコア0〜1、2026-09-27。中国系ラボがオープンウェイト戦略に注力する理由を推測する議論。
シグナル
  • 今日Lemmyで最も伸びたのは新モデル自体の話題ではなく、AnthropicとOpenAIの「安全性アピールは規制の主導権争いでは」という懐疑論(news、net 42)と、AnthropicとPentagonの対立(legalnews、スコア26)。Lemmy全体の空気として、企業のAI安全性メッセージへの不信感が強い。
  • Claude Opus 5.5に関する話題はLemmy上ではほぼ全てc/ai_reddit(Reddit r/ArtificialIntelligence・r/ClaudeCodeのミラーボット)経由で、Lemmyネイティブの議論というより「Redditで話題になっていることの又聞き」という状態。
  • c/fuck_aiのようなAI批判系コミュニティ(8千人規模)が、Googleのデータ削除の実装不備のような「AI企業への不信」ネタで最もエンゲージメントを稼いでいる。
  • c/[email protected] は購読者3人・投稿0件で、ローカルLLM/オープンウェイトの技術的な議論はLemmy上にはほぼ存在しない(別コミュニティ名 c/localllm の投稿1件のみ確認、本文未精査)。
Limits
  • Lemmyは規模が小さく、LLM専用の活発なコミュニティが存在しない。今回の10件のうち半分(#7〜10、Chinese labs分含めれば実質過半数)はc/ai_reddit経由のRedditミラー投稿で、Lemmyネイティブの一次言論とは言い難い。
  • c/[email protected]は購読者3人・投稿0件で空振り。オープンウェイトモデルのベンチマークやAPI価格改定など、ローカルLLM系の技術的な話題はLemmy上でほぼ見つからなかった。
  • lemmy.world以外のインスタンス(lemmy.ml、lemm.ee等)は横断APIで検索したが、上記10件以外に本日付の重複しない有力な投稿は見つからなかった。
  • 各投稿の本文全文とコメント欄は代表的なものだけ深掘りし、全コメントは精査していない。

推奨アクション

  • Reddit収集の検索語をモデル名・企業名ベース(GPT-6、Claude Opus 5.5、open weightなど)に切り替えて再収集する。
  • X収集は地域トレンドに依存せず、AI関連ハッシュタグや著名AI論者アカウントを明示して再実行する。
  • AnthropicとPentagonの法廷闘争、および安全性メッセージへの懐疑論の続報を優先的に追跡する。
  • Xiaomi MiMo V2.6 Proの評価が独立ベンチマークでも裏付けられるか次回収集で確認する。

データ品質メモ

RedditとXは検索語の設計ミス(一般語の一致・無関係な地域トレンド)により実質的な知見をほぼ得られなかった一方、YouTube・Bluesky・Lemmyの3プラットフォームは完了基準に近い件数を収集し、Opus 5.5/GPT-6論争とXiaomiの躍進という結論で独立に一致した。