FORSMILE
第8号2026年10月11日発行 / 対象期間 10/5〜10/11Read in English

今週のAIニュース11選 — 小型モデルの値下げと、AIの「出所」を確かめる仕組みの週

今週の総括

今週の軸は2つです。1つ目はモデルの値段と届く範囲が下へ広がったことです。Anthropicは小型モデルのClaude Haiku 5.5(入力$0.10・出力$0.50)を出し、旧Haikuより平均約75%安いと説明しました。OpenAIは新しいGPT-6を、無料のFreeとGoを含むChatGPT全体へ広げました。2つ目はAIが作ったものの「出所」をめぐる動きです。OpenAIはEU向けに文章の透かしを導入すると公表しましたが、検出は短文や編集で崩れるとも自ら書いています。Googleは画像・動画・音声の判定ツールSynthID Detectorを全世界へ公開し、OpenAIはAIを使った影響工作の遮断を公表し、ロシア発の1件を初のカテゴリ5と評価しました。Anthropicも欺瞞的な活動の禁止を1節にまとめた利用ポリシーを11月12日に施行します。作る側の値下げと、見分ける側の仕組みが同じ週に出た形で、見分ける側はまだ完成していません。

モデル・製品

Anthropic、Claude Haiku 5.5を公開。入力$0.10・出力$0.50で、旧Haikuより平均約75%安いと説明

最も安く最も速い小型モデル。同時にSonnet 5.5のキャッシュ読み出しも半額にした。

10月7日公開。100万トークンあたりの価格は、100Kトークンまでのプロンプトで入力$0.10・出力$0.50(100K超は$0.50/$2.50)で、Haiku 4.5は$1/$5、Sonnet 5.5は$2/$10です。Anthropicは「平均すると運用費が約75%下がる」と説明していますが、新しいトークナイザで同じ作業に使うトークンがやや増える分も織り込んだ数字だと脚注にあります。Haikuで初めて推論の強さ(effort)を調整でき、コンテキストは100万トークンです(Claude Codeのリリースノートより)。社内評価ではTerminal-Bench 4.0が39.2%(Haiku 4.5は0.0%、Sonnet 5.5は70.6%)、OSWorld 2.1のオフライン版が72.4%(Sonnet 5.5は83.9%)でした。同日、Sonnet 5.5のキャッシュ読み出しを$0.20から$0.10へ下げ(多くのエージェント作業で約20%安くなるとの説明)、Max・Teamの契約者にはClaude Platformで使える月次APIクレジット(Max 5xは$100、Max 20xは$200、Teamは最大$500を共有)を今週中に配ると発表しました。

So What

要約・分類・圧縮・サブエージェントのような、小さな処理を大量に回している場合は単価の見直し対象です。ただしAnthropic自身が、複雑なコーディングはSonnet 5.5やOpus 5.5のほうが向くと書いています。数字は同社の評価で、サイバー関連の安全装置はSonnet 5.5より緩いものの、ペネトレーションテストなどは引き続き止める設計です。

モデル・製品

OpenAI、ChatGPTのChatに新しいGPT-6と「Intelligent UI」を投入。無料枠にも翌日から

答えを図・ボタン・フォーム・自作ツールで返せるようにし、考えながら先に答え始める。

10月7日発表。週に12億人超が使うChatGPTのChatタブで、有料のPlus・Pro・Business・EnterpriseはGPT-6 Sol、FreeとGoはGPT-6 Lunaが動きます(有料は当日、FreeとGoは翌日から。Enterpriseは管理者設定次第)。Intelligent UIは、質問に応じてモデルが文章・図・タップできるボタン・フォーム・グラフ・計算機のような小さなツールを組み合わせて返す機能です。もう一つの変更は「考えながら答える」ことで、Web検索が要る質問ではGPT-6 InstantがGPT-5.6 Instantより平均44%早く答え始めるとOpenAIは書いています(社内評価)。Work機能とCodexのモデルは今回変わりません。

So What

ChatGPTで調べ物や学習に使う人は、無料でも回答の形が変わります。仕事や開発で使うWork・Codexは対象外なので、そちらの挙動が変わったと感じても今回の発表では説明できません。44%などの数字はOpenAIの社内評価です。

モデル・製品

Mistral、1兆パラメータの「Mistral Large 4」をパブリックプレビュー。重みは月末に公開予定

アクティブ520億のマルチモーダルモデルで、重みの公開を約束している。

10月6日、Mistral StudioのプレビューAPIで公開。総パラメータ1兆・アクティブ520億のネイティブ・マルチモーダルで、欧州にある自社データセンターのNVIDIA Grace Blackwell 3,800基で一から学習したとしています。重みは今月末までに公開するとあり、それまでサイバー分野の専門家や当局などが、制限を弱めた同じモデルでレッドチーム評価を行います。Mistral自身が示した数字は、DeepSWE v1.1が61.7%、Terminal-Bench 4が28.3%で、Artificial Analysisのサイバー指数ではオープンウェイトの中で上位とされています。「Claude Opus 5.5やGPT-6 Astraが、脆弱性の再現タスクでは拒否して点数がほぼゼロになる」とも書いていますが、これはMistralの主張です。

So What

自社環境で動かせる高性能モデルが、月末に1つ増える見込みです。ただし本稿時点では重みは公開されておらず、ベンチマークはすべてMistral側の提示です(第三者として挙がっているのはArtificial Analysisとvals.ai)。ライセンス条件はこの発表からは確認できていないので、使う前に公開ページで確かめる必要があります。

開発ツール

Claude Code 2.1.290〜2.1.296。Haiku 5.5に対応し、フックの失敗で「止める」設定が可能に

10月5〜9日に7版。Haiku 5.5対応、エージェントのeffort指定、フックの失敗時ブロックなどが入った。

10月5日から9日にかけて2.1.290〜2.1.296が出ました。2.1.293でClaude Haiku 5.5(`claude-haiku-5-5`)が加わり、AnthropicのAPIでの既定のHaikuになりました。2.1.292はAgentツールに`effort`パラメータを追加し、サブエージェントを指定の推論の強さで走らせられます。2.1.295は、コマンド・HTTPフックに`onFailure: "block"`を追加しました。フックが起動できない、時間切れになる、想定外の終了コードを返すときに、処理を通さず止めます。同じ版でOSC 7501に対応し、対応端末はClaude Codeが作業中か、入力待ちか、完了かを表示できます。2.1.296にはReadツールの`allow_large`(サイズ上限を超えるテキストを1回で読む)が入りました。2.1.291は、2.1.290で起きたクラウドセッションの権限確認への回答が失われる退行と、2.1.288で起きた終了時に最後のメッセージが消える退行の修正です。

So What

フックで危険な操作を止めている人は、`onFailure: "block"`で「フックが動かなかったら通す」を「止める」に変えられます。2.1.290を使っているクラウドセッションは、権限確認の回答が落ちる退行があったので2.1.291以降への更新が必要です。リリースノートは変更点の列挙で、動作の検証結果ではありません。

市場・業界構造

OpenAI、ChatGPT広告に画像生成中の広告枠を追加。米国のFree・Goで今月から試験

広告は画像と別枠で表示し、回答には影響しないと説明。計測パートナーも拡大した。

10月5日発表。新しい形式は、FreeとGoの利用者がChatGPTで画像を生成している最中に表示する画像広告で、広告であることを明示し、作っている画像とは分けて表示します。試験は今月中に米国で一部の広告主から始まります。OpenAIは「広告は回答に影響しない」としています。あわせて、Hightouch・Tealium・LiveRampとの連携、AppsFlyerやAdjustなど多数の計測パートナーとの対応、DoubleVerifyとIASによる広告環境の評価パイロットも発表しました。成果の例としては、DV Rockerboxによる「WeightWatchersの獲得単価が検索広告の平均より15.3%低い」、Triple Whaleによる「Portland Leatherへの訪問者の93%が新規」などが挙がっています。

So What

無料のChatGPTを使う側にとっては、画像生成中に広告が出るようになる動きです(米国で試験の段階)。成果の数字はOpenAIが選んだ数社の事例で、一般的な水準ではありません。日本での提供時期はこの発表に書かれていません。

市場・業界構造

NVIDIAとMicrosoft、Windows向け「RTX Spark」を発表。ノートは10月16日発売

統合メモリ最大128GBでローカルAIを動かすWindows機。卓上のDGX Stationも出す。

10月7日のイベントで発表。RTX SparkはBlackwell世代のGPUとGrace CPUを組み合わせたチップで、FP4で1ペタフロップス、統合メモリ最大128GBです。Surface Laptop Ultraをはじめ、Acer・ASUS・Dell・HP・Lenovo・Microsoft・MSI・Gigabyteから搭載機が出ます。ノートの予約は当日に始まり、発売は10月16日、コンパクトなデスクトップは11月の予定です。MicrosoftはエージェントをOSの管理下で安全に動かすMicrosoft Execution Containers(MXC)を一般提供としました。あわせてDGX Station for Windows(GB300、コヒーレントメモリ748GB、FP4で最大20ペタフロップス)を披露しましたが、提供時期は示されていません。

So What

手元のPCでモデルを動かしたい人に、128GBクラスのWindows機の選択肢が10月16日から現れます。この発表には価格が書かれていません。「クラウドモデルと同等の知能」という説明はNVIDIAの主張で、性能は発売後の第三者による検証を待つ必要があります。

規制・安全

Anthropic、「Cyber Mission」を開始。重要インフラ向けプログラムと、OSS向けの無料スキャンを提供

OT分野の11社と組み、OSSには定期的な無料スキャンを開く。報告は人の確認なしで届く。

10月8日発表。Critical Infrastructure Defense Program(CIDP)は、電力・水道・交通の制御系(OT)を守る事業者に、Claudeのモデルと常駐エンジニア、脅威調査を提供します。創設パートナーはAccenture・Booz Allen・CrowdStrike・Deloitte・Dragos・Hitachi・Insane Cyber・Nozomi Networks・Palo Alto Networks・PwC・Rockwell Automationの11社です。OSS ScannerはOSSプロジェクトが申し込むと、最上位のモデルによる定期スキャンを無料で受けられるサービスで、報告には悪用手順(PoC)・説明・修正案が付きます。報告は人のレビューなしで送られるため、深刻度の誤りなどが含まれうるとAnthropicは書き、真陽性率は90%超を見込むとしています。Project Glasswingは、拡充したCyber Verification Programに統合されました。

So What

OSSを保守している人は、無料で脆弱性報告を受けられる申し込み先が増えました。ただし報告は人の確認前の状態で届くので、深刻度や再現性を自分で確かめる前提になります。「真陽性率90%超」は見込みで、実績ではありません。

規制・安全

Anthropic、利用ポリシーを改定。欺瞞的な活動の禁止を1節にまとめ、11月12日に施行

多くは既存ルールの明確化。物理機器への接続と、モデルへの虐待的な扱いに新しい条項が入る。

10月8日公開で、施行は11月12日です。Anthropicは「ほとんどが既存ルールの明確化」と説明しています。新設の「Do Not Engage in Deceptive Campaigns or Artificial Activity」は、偽アカウントで発信元を隠す、投稿を水増しするなどの欺瞞的な活動を、政治・商業を問わず1節にまとめました。選挙の節は「民主的プロセスを損なわない」に改題し、個別化した投票・選挙運動のターゲティングの包括的な禁止は外しました(欺瞞や個人データの悪用を伴うものは別の節で引き続き禁止)。監視の節には「捜査・逮捕・起訴の対象を決める、または勧めることにClaudeを使えない」が明記されました。高リスク用途の節には、自律的に物理動作をする機器へ接続する場合の条件(人が観察して止められること、切断時に安全な状態を保てること)が加わります。持続的で無意味な虐待的行為の禁止も入りました。

So What

Claudeを業務に組み込んでいる場合は、11月12日までに用途が欺瞞的な活動・監視・物理機器・高リスク用途に当たらないかを確認する時期です。Anthropicは多くの変更が「実際の運用の変更ではない」と書いていますが、運用上どこまで同じかは同社の判断です。

規制・安全

OpenAI、ロシアとイランの「偽の看板」型影響工作を遮断と公表。ロシア側は初のカテゴリ5

AIで記事や報告を作り、実在の人を巻き込んだ「シンクタンク」や偽記者を使う工作を停止した。

10月8日公表。ロシア発の「Dark Clark」は、ラテンアメリカで「Social Research Center」という調査機関を、偽の人物「Mia Clark」名義で運営していました。現地の職員は雇い主がロシアの組織だと知らなかったとみられ、OpenAIは影響工作の規模を測るBreakout Scaleでカテゴリ5(6段階の上から2番目)と評価しました。同社が報告を始めてから初のカテゴリ5です。イラン発の「Bogus Bylines」は7人の偽ジャーナリストを使い、長文記事を世界各地の中小メディアに売り込んでいて、カテゴリ4でした。どちらも、ソーシャルメディアだけでなく主流メディアに内容を掲載させることに成功しています(内容の一部はOpenAIのモデルで作られたものではありません)。OpenAIは、過去2年半に暴いた30件の工作の中でも、実際の媒体に載せようとした工作ほど届く範囲が大きい傾向があると述べています。

So What

外部から寄稿を受ける、あるいは「調査機関」名義の資料を出典にするとき、書き手と組織の実在を別経路で確認する根拠が増えました。AI文章の見た目では見抜けないので、OpenAIが示す特徴は「実際の媒体を狙う」という運用面の点です。報告は同社が観測できた範囲で、帰属の一部は推定です。

規制・安全

OpenAI、EU向けにChatGPTとCodexの出力へ目に見えない透かしを入れる方針を公表

APIは希望者のみ、検出ツールは研究者や専門機関に限定。短文や編集で検出率が落ちると自ら説明。

10月5日発表。EU AI法が求める「機械可読な形でAI生成文を識別できること」への対応で、技術名はtextGrain(単語の選び方に統計的な信号を埋め込む方式)です。APIでは世界中の顧客が対象モデルで希望すれば有効にでき(既定はオフ)、ChatGPTとCodexの出力には今後数週間でEUの全プランに順次入れます。検出ツールの申請は開始されましたが、当面は承認された研究者・専門機関だけが使えます。1%の誤検出率に設定した評価で、200トークンの文章の検出率は約80%、400トークンで約95%です。400トークンの文章で10%の単語を類義語に置き換えると検出率は約92%から66%、25%を置き換えると17%に下がります。数学のように言い換えの余地が小さい内容では検出率はさらに下がります。

So What

「AI文章を検出ツールで見分ける」手段は、今のところ一般には公開されず、短文や編集済みの文章では当てになりません。OpenAIは、透かしが見つからなくても人が書いた証明にはならないと明記しています。ChatGPTへの透かしの導入はEUのみで、日本の利用者に入るかどうかは書かれていません。

規制・安全

Google、SynthID Detectorを英語で全世界に公開。OpenAIやNVIDIAなど他社の生成物も判定対象

誰でも画像・動画・音声のAI生成かどうかを確かめられる。対象はテキストではなくメディア。

10月7日公開。Googleによると、2023年のSynthID開始以降、1,800億枚超の画像・動画と24万年分の音声に透かしを入れました。昨年は報道関係者向けの早期版でしたが、今回英語で全世界の誰でも使える形になりました。判定できるのはGoogleのほか、OpenAI・NVIDIA・Kakaoの生成物で、Appleも近く加わる予定です。Search・Geminiアプリ・Chromeの検証機能は、すでに1日100万件超のリクエストを処理しているといいます。対象は画像・動画・音声で、テキストの透かしは含みません。

So What

画像や音声の出所が気になったときに、一般の人も使える確認先が1つ増えました。ただし判定できるのは対応する事業者の透かしが入ったものだけで、検出されなかった場合に何が言えるかはGoogleの発表に書かれていません。日本語での提供は書かれていません。

継続監視(今号では確定情報が無かったもの)

  • Mistral Large 4の重みは「今月末まで」の公開予定で、ライセンス条件は発表から確認できていない。公開された時点で扱う。
  • EUの科学パネルが10月9日に特別会合を開き、「制御喪失の事案」を調べたうえで勧告を委員会へ提示するとした(欧州委員会の発表)。勧告の中身と、質問を受けた企業の回答は公表されていないので、中身が出るのを待つ。
  • Google Cloudが10月8日に「Gemini agent」を発表したが、一次資料はGoogleのブログの短い告知だけで、機能や価格を確認できていない。Google Cloud側の詳細を確認できた時点で扱う。
  • OpenAIは10月6日に、社内の最先端モデルが出した数学の新しい結果を公開し、そのモデルの公開を「責任ある形で進めている」と書いた。モデルは未公開で、検証できる材料が限られるので項目にしていない。
  • AnthropicのGenesis Mission向け1.5億ドル(3年間)、GitHubのReviewBench(10月5日)、NVIDIAのNemotronによるIOI・IMOの金メダル級の結果(10月7日)は確認したが、読者にとっての変化を書ける材料が薄いので今回は見送った。
  • 資金調達・買収は、一次情報(当事者の発表や提出書類)で確認できたものが今週は無かったので、項目にしていない。Meta・Apple・中国勢の新規発表も、一次情報で確認できていない。
  • OpenAIのGPT-6のFree・Go向け展開(10月8日から)と、AnthropicのMax・Team向けAPIクレジット(「今週中」)が、実際に行き渡ったかは未確認。

各項目の「一次」は当事者自身の発表(公式ブログ・プレスリリース・公式ドキュメント等)、「参考」は報道・第三者分析です。数値や日付は発行時点で確認したものを記載しています。

← 週刊AIニュースの一覧へ