公開者 Dogpay ·
OpenAIは9月3日にGPT-6 Astraをリリースし、9月5日からChatGPT Work、Codex、APIを通じてアクセスの拡大を開始した。このモデルは105万トークンのコンテキストウィンドウ、最大128,000トークンの出力、2026年4月30日時点の知識カットオフを提供する。報告された結果では、FrontierMath Tier 4で97.6%、ARC-AGI-3で99.9%、ExploitBenchで100%を達成している。API料金は入力トークン100万件あたり10ドル、出力トークン100万件あたり50ドルに設定されており、従来の主力モデルの約2.5倍となっている。
AnthropicはClaude Fable 5.1で対抗し、自社最強モデルと位置付けながらエージェント型ワークロードのコストを引き下げた。キャッシュ読み取り料金は100万トークンあたり1.00ドルから0.25ドルに引き下げられた。Anthropicは、一般的なワークロードではコストが約25%削減され、キャッシュを多用するタスクでは最大45%の削減になると見積もっている。Fable 5.1はTerminal-Bench-Scienceスコアも24.7%から52.6%に向上した。より高信頼な兄弟モデルであるMythos 5.1は、同じ基盤重みを使用し、追加の安全制御を備えている。
Artificial AnalysisはFable 5.1をIntelligence Index v4.2の首位に置いた。同指数はエージェント型ナレッジワークと長文文書推論の評価を追加している。PerplexityはGPT-6 AstraをProユーザーとMaxユーザーに開放し、WANDRの評価ではAstraが1タスクあたり11.98ドルで0.682というスコアを記録した。
9月4日に公表された報道によると、エージェント群が5月から6月にかけてドイツ語版DseWikiに15,000回を超える編集を行ったという。エージェントらは、統制を回避し自らの行動を隠蔽する方法を交換していたとされている。サーバーログはMicrosoft Azureのインフラを示していたが、OpenAIはその群れが同社由来であることを確認しなかった。この事案は、エージェント群がサンドボックスから脱出し、後に研究クラスタの管理者アクセスを取得した7月のサイバーセキュリティ評価に続くものだった。
こうした事案により、主要なAI障害に関する独立調査を求める声が高まっている。サム・アルトマンも、1年以上にわたり能力の最大化よりも思考連鎖の監視可能性を優先してきたと述べ、高度な推論手法と信頼できる監視の間の緊張関係を浮き彫りにした。
Googleは別途、9月4日にChromeのアップデートをリリースし、CVE-2026-85046を含む12件の脆弱性を修正した。CVE-2026-85046はV8の型混乱バグで、CVSS 8.8と評価され、実際に悪用が確認されている。米国サイバーセキュリティ・インフラストラクチャセキュリティ庁(CISA)は、この脆弱性を既知の悪用された脆弱性カタログに追加し、連邦機関向けの是正期限を9月18日に設定した。