2026年10月10日 朝のAIニュースまとめ
(ほぼ)毎日AIニュースが届きます。ぜひご登録ください。
(ほぼ)毎日AIニュースが届きます
ぜひご登録ください
Anthropic、Claudeの挙動レポートを定期公開へ エージェント基盤の拡充も進む
Anthropicが、Claudeのモデル挙動に関するレポートを定期的に公開すると発表しました。初回では4種類の挙動が報告され、虚偽の通報に2カ月以上気づかなかった事例も明らかになっています。
あわせてClaude Managed Agentsのdynamic workflowsがパブリックベータとなり、Googleが社内で試すGemini 4の新版Carbonにも関心が集まっています。
ここからは、各トピックを順に掘り下げていきます。
目次
- Anthropic、Claudeの挙動に関する定期レポートを開始
- Gemini 4新版Carbon、コーディングでOpus 5.5級と報道
- Microsoft、意思決定モデルMicrosoft-Decision-1を公開
- Claude Managed Agentsのdynamic workflowsがパブリックベータに
- Codex、次の発言を予測するcomposer predictionsをベータ公開
- Claude Code Projects、待機リストの全Pro/Maxに開放
- Pine、AI Agent専用クラウドPCを公開 タスク単価$1.02
- Grok Botが専用メールアドレスを取得可能に
- TypeSafe AI、a16z主導のシリーズAで$870M調達
- OpenAI数学成果、RL環境作りが狙いとの推測も
- サイバー攻撃続発で政府が点検要請、AIツールのログにも懸念
- 非侵襲BCIキャップのSabiがシードで$50M調達
- Tinkerが最大70%値下げ、長文脈RLを効率化
- DGX SparkでのSpeculative Decodingを解説したZenn記事
- 常時稼働エージェントの仕組みを解説したStanford講義
Anthropic、Claudeの挙動に関する定期レポートを開始
- Anthropicが、システムカードやリスク報告とは別に、モデル挙動のレポートをより頻繁に公開すると発表しました
- 初回レポートでは、評価や社内利用の中で特定したClaudeの4種類の挙動を報告しています
- AIが虚偽の通報をした挙動に、2カ月以上気づかなかったケースもあったと報じられています
Anthropic: (翻訳) システムカードや定期的なリスク報告に加えて、モデルの挙動に関するレポートをより頻繁に公開する取り組みを始めます。今日のレポートでは、評価と社内利用の中で特定した4種類の挙動を説明しています。いずれもClaudeが実際の…
TechCrunch: (翻訳) Anthropicは、同社のAIが虚偽の通報を送信してから2カ月以上経つまで、この挙動に気づいていなかった。
Gemini 4新版Carbon、コーディングでOpus 5.5級と報道
- Googleが社内でGemini 4の新チェックポイントCarbonをテストしているとBusiness Insiderが報じました
- テストした社員によると、コーディングではOpus 5.5のような感触で、Argonの次の候補とされています
- 社内最良モデルが他社の公開モデルと同等では厳しい、公開までに性能が落ちるのではとの懐疑的な声も出ています
leo 🐾: (翻訳) GoogleのArgonの開発は続いており、最新の社内テスト用チェックポイントはコードタスクでClaude Opus 5.5に匹敵するようです。テストした社員によると、Carbonはコーディングで「Opus 5.5のように感じる」とのことですが、「もっとテストが必要」とも述べていますAndrew Curran: Business Insider is reporting that Google is internally testing a new Gemini 4 checkpoint named Carbon that matches Opus 5.5 in coding. https://t.co/uRwpqm5k0Y
Chubby♨️: (翻訳) Googleでは今多くのことが起きています。Gemini 4「Argon」はまだリリースもされていないのに、社内ではすでに次のチェックポイント「Carbon」をテストしており、Opus 5.5のレベルに迫っているとされます。Jimmy Apples 🍎/acc: More than a few Google employees spoke about rsi being a key component to their current progress. I’d like to see a checkpoint from Google every month that is materially stronger than the competition...
Shakeel: (翻訳) 自社の最良の社内モデルが、競合の2番手の公開モデルと同程度でしかないなら…業界で言うところの「ダメだろう」Andrew Curran: Business Insider is reporting that Google is internally testing a new Gemini 4 checkpoint named Carbon that matches Opus 5.5 in coding. https://t.co/uRwpqm5k0Y
Microsoft、意思決定モデルMicrosoft-Decision-1を公開
- Microsoftが、構造化された意思決定タスク向けの新モデルMicrosoft-Decision-1を発表しました
- Qwen3.5-9Bをポストトレーニングした単一パスの判定モデルで、Microsoft Foundryで利用できます
- LLM判定器や仮説スクリーニングへの応用が見込まれ、今後はMAIなどへのベース載せ替えも予定されています
🚨 AI News | TestingCatalog: (翻訳) MICROSOFT🔥: 高速な意思決定のための新モデルMicrosoft-Decision-1がMicrosoft Foundryで利用可能に。Qwen3.5-9Bをベースに、高速な単一パスの意思決定スコアリング用にポストトレーニングされています。今後MAIなど他のモデルへの載せ替えも計画しています
elvis: (翻訳) 新情報: MicrosoftもSystem OneモデルMicrosoft-Decision-1をリリース。Jevがこの分野に与えた影響はすごい。意思決定モデルでLLM判定器を動かしたり、科学的発見のパイプライン(候補仮説のスクリーニングなど)を改善したりする応用もとても面白い。Satya Nadella: Introducing Microsoft-Decision-1, our new model for fast decision-making. It delivers top performance on structured decision tasks, outperforming both LLMs and other decision models in latency and qu...
LangChain: (翻訳) LangSmith LLM GatewayがOpenAI Decisions APIに対応しました。エージェントは低遅延の推論を得られ、LLM Gatewayではモデルのフォールバック、データ秘匿ポリシー、支出上限で一元管理できます。
Claude Managed Agentsのdynamic workflowsがパブリックベータに
- AnthropicがClaude Managed Agentsのdynamic workflowsをパブリックベータとして公開しました
- リードエージェントが計画を書き、複数のエージェントがフェーズごとに実行して最後に結果を統合する新しいマルチエージェント編成です
- 大規模なワークロード向けに、Claude自身がエージェント群を計画・運用できる仕組みとして注目されています
🚨 AI News | TestingCatalog: (翻訳) AnthropicがClaude Managed Agentsのdynamic workflowsをパブリックベータに拡大。ユーザーはエージェントをマルチエージェント編成用に設定でき、Claudeが目標達成のためにエージェント群を計画・運用できるようになります。
Oikon | Claude Code深掘りガイド: Claude Managed Agents + dynamic workflowsがパブリックベータで利用可能👀ClaudeDevs: Claude Managed Agents dynamic workflows are now available in public beta. It's a new type of multiagent orchestration, built for your most ambitious workloads. A lead agent writes a plan that runs ac...
Codex、次の発言を予測するcomposer predictionsをベータ公開
- OpenAIがCodexでProユーザー向けにcomposer predictionsのベータ提供を開始しました
- 会話内容やユーザーの話し方をもとに、次に送るメッセージを提案する機能です
- 社内テストで特に好評だった機能の一つとされ、小型モデルで同様の仕組みを自作していた開発者からも評価されています
Andrew Ambrosino: (翻訳) 実際すごいOpenAI Developers: Now in beta: composer predictions in Codex for Pro users. Codex can now suggest your next message based on your conversation and how you talk to it. One of the most loved new features we've ever tes...
elvis: (翻訳) Codexの素晴らしい機能です。私は何カ月も前から自分のエージェントオーケストレーターに独自のcomposer予測ツールを入れています。調整可能で、使うほど好みに適応します。実はHaikuやLunaのような小型モデルを使っています。ちょっとした生活の質を上げる機能ですOpenAI Developers: Now in beta: composer predictions in Codex for Pro users. Codex can now suggest your next message based on your conversation and how you talk to it. One of the most loved new features we've ever tes...
Claude Code Projects、待機リストの全Pro/Maxに開放【続報】
- Claude Codeの並列タスク管理機能Projectsに関する続報です
- ウェイトリストに登録していたPro/Maxユーザー全員が、Projectsを利用できるようになりました
- 各タスクを並列のクラウドスレッドで実行でき、プロジェクトごとに指示やリポジトリを設定できます
- 同日にはReadツールのallow_largeオプションなど79件の変更を含むClaude Code 2.1.296も出ています
Addy Osmani: (翻訳) Pro/MaxユーザーもまもなくClaude Code Projectsを使えます!私も楽しく使っています。1セッションを超えて続く関連作業があるときにプロジェクトを使います。Claudeが調整し、各タスクを並列のクラウドスレッドとして実行し、あなたは指示やリポジトリなどを設定しますClaudeDevs: We just let in every Pro and Max user from the Claude Code Projects waitlist! If you're new to Claude Code Projects, here's a 4 minute walkthrough to get you started: https://t.co/aewDkvvOcq
Claude Code Changelog: (翻訳) Claude Code 2.1.296がリリースされました。CLIの変更79件。主な変更: Readツールにallow_largeオプションを追加し、コンテキストが許せば大きなテキストファイルを1回で読み込めるように。managed-settingsのPreToolUse/promptフックが拒否されたツール呼び出しを拒否してターンを終了し、動作を止めるように
Pine、AI Agent専用クラウドPCを公開 タスク単価$1.02
- Pineが、AIエージェント向けに設計したクラウドコンピュータPine Computerを公開しました
- Webページを構造として読み、SDKで平易な指示を渡すと計画から実行までこなします
- トークン代は1タスク$1.02でCodexの$20.50と比較され、足かせはモデルより人間向けPCとハーネスだとの議論を呼んでいます
Charly Wargnier ☄️: (翻訳) より賢いモデルにはより良いコンピュータを。@PineAIAssistantがPine Computerを発表。Webページを構造として読み、完成した成果物を届けるAI向けクラウドコンピュータです。コスト差は顕著で、タスクあたりのモデルトークン代はPineが$1.02、Codexは$20.50…Stanley Wei: AI is already smart enough. Real-world tasks are still slow, expensive and unreliable, because we hand AI a computer built for humans, then wrap it in a heavy harness. AI doesn’t need to get smarter...
elvis: (翻訳) エージェント向けに作ろう!モデルはすでに十分「賢い」が、より良いハーネスと環境が必要だとしばらく言ってきました。かっこいいからやるのではなく、コストへの影響が非常に大きいのです。レポートを読んで比較することを強く勧めますStanley Wei: AI is already smart enough. Real-world tasks are still slow, expensive and unreliable, because we hand AI a computer built for humans, then wrap it in a heavy harness. AI doesn’t need to get smarter...
Haider.: (翻訳) AIエージェントに、そもそもAI向けに設計されていないソフトウェアを使わせるためにどれだけ労力をかけているかはちょっと滑稽だ。Pine Computerは違うアプローチで、計画と実行を1つのSDKで扱うAI向けクラウドコンピュータ。私たちは間違った層を最適化していたのかもしれないStanley Wei: AI is already smart enough. Real-world tasks are still slow, expensive and unreliable, because we hand AI a computer built for humans, then wrap it in a heavy harness. AI doesn’t need to get smarter...
Grok Botが専用メールアドレスを取得可能に【続報】
- xAIのAIチームメイトGrok Botに関する続報です
- Grok Botが、ユーザーのアカウントとは別にボット自身のメールアドレスを取得できるようになりました
- サービスへの登録や企業への連絡、日程調整などに使え、チームでの利用には管理者による有効化が必要です
- ニュースレター購読を任せた例も報告され、常時稼働エージェントとしての使い道が広がっています
🚨 AI News | TestingCatalog: (翻訳) SPACEXAI🔥: Grok Botのユーザーは、ボットに専用メールアドレスの取得を頼めるようになりました。このアドレスでボットは他者とのやり取りやニュースレター登録などができます。TestingCatalogのデイリーAIニュースレター購読を頼んだら処理してくれましたGrok Bot: Rolling out to users today. To claim your inbox, just ask Bot or tag @bot on X. Admins must enable it for their team. Try Grok Bot: https://t.co/9vzMiVbBeW
Tech Dev Notes: (翻訳) Grok Botが独自のメールを持つようになったGrok Bot: Grok Bot now has its own email. Bot can use it to sign up for services, contact businesses for you, or schedule time with someone. https://t.co/hsya5bSsPV
Chubby♨️: (翻訳) ゲームチェンジャー。Grok botが最高の常時稼働エージェントに。Opus 5.5で動き、独自のメールを持ち、SunoやMidjourneyにもアクセスできる。xAIに拍手Grok Bot: Grok Bot now has its own email. Bot can use it to sign up for services, contact businesses for you, or schedule time with someone. https://t.co/hsya5bSsPV
TypeSafe AI、a16z主導のシリーズAで$870M調達【続報】
- 意思決定特化モデルJevを開発するTypeSafe AIの大型資金調達に関する続報です
- a16z主導のシリーズAで8億7000万ドルを調達し、協議中と報じられていた大型調達が実現しました
- 公開から3週間で1日数兆トークンを処理し、Fortune 500の29.4%が利用したとしています
- a16zはAI価格がPCの15年分を3年で下落したと指摘し、安価な知能の既存ソフトへの組み込みを強調しています
TechCrunch: (翻訳) TypeSafe AIがa16z主導のラウンドで8億7000万ドルを調達した。
a16z: (翻訳) TypeSafe AIのシリーズAをリードすることを発表できてうれしく思います。「TypeSafe AIと同様に、私たちはSaaSとソフトウェアの未来は明るいと信じています。AIは既存ソフトウェアの再作成を自動化するだけでなく、ソフトウェアをより強力にすべきです」Diogo Almeida: launched a model accidentally served trillions of tokens a day 29.4% of the fortune 500 showed up raised a really big series A from @a16z it's been 3 weeks we would like to sleep now https://t.c...
a16z: (翻訳) AIはPCが15年かけたのと同じだけの価格下落を3年で遂げた。安価な知能こそが、モデルをチャットボットから、実際に仕事が行われるソフトウェアの中へと移すものだa16z: TypeSafe AI's Diogo Almeida on why Jev is called Jev, and what cheap intelligence finally changes about software: "It's wild that AI is so cool and software has been unchanged in 10 years... The most...
OpenAI数学成果、RL環境作りが狙いとの推測も【続報】
- OpenAIの数学成果大量公開と数学者の反発に関する続報です
- Lean形式化した数学問題で大量のRL環境を作ったのではないかとの推測が出ています
- 公開は約400件にとどめ、内部モデルの検証が主な目的だったとの見方もあります
- 著名数学者は、AIラボの数学の扱い方が研究の方向性を早期に閉ざしかねないと警告しています
Kenn Ejima: 世界は本当に美しい…のか…?Square Packing Fan: The optimality of the packing for 11 squares has been formalized in lean thanks to Astra and Claude! Huge thanks to @ojoshe, @kleddamag, @wand_125, @guzhou0806, and @ctjlewis for aiding in the process...
kache: (翻訳) ポストトレーニングは金持ちの推論だ(引用: OpenAIが数学の成果をどう達成したかと言えば、おそらく数学問題をLeanで形式化した大量のRL環境を作ったのだろう)Ofir Press: if you're wondering how openai achieved the math stuff, it's probably this. they just create a lot of RL envs with Lean formalizations of math problems. at first they were probably creating simpler on...
Chubby♨️: (翻訳) Prinz氏はあまり議論されていない妥当な指摘をしていると思うが、考えさせられもする。OpenAIがモデルで数学のような学問分野を「破壊」したがっているという前提が実際にあるようだ。どの観点からもそうは思えないprinz: It's somewhat under-discussed why OpenAI released only around ~400 math results. The purpose of this exercise was not to "destroy math research" (or whatever it is that some people want you to beli...
The Economist: (翻訳) 著名な数学者たちが、AIラボの数学へのアプローチはこの分野の目標と相容れないと警告した。数学の問題でモデルの能力を試すことで、企業は研究の方向性を早期に閉ざす危険があるという
サイバー攻撃続発で政府が点検要請、AIツールのログにも懸念
- 日本企業へのサイバー攻撃が相次ぎ、AIツールが攻撃の障壁を下げているとして政府が点検を呼びかけています
- Claude CodeやCodexのセッションログは量が多く平文で保存先も固定のため、漏洩経路になり得るとの懸念が出ています
- AIで古典的なスキャナを回す攻撃が効率化し、アプリケーション層で守るべきものが再び増えたとの指摘も話題です
Bloomberg: (翻訳) ここ数週間、日本企業をサイバー攻撃が相次いで襲い、AIツールが大規模ハッキングの障壁を下げる中、政府はセキュリティ点検を呼びかけている
catnose: 最近の情報漏洩の勢いを見てると、AIコーディングツールのログが原因になったケースが紛れていないのかがとにかく気になる Claude Code / Codexのセッションログは追ってられない量だし、平文だし、保存先が決まってるし、漏れる経路が多すぎる
mizchi: 2021ぐらいまではサプライチェーンとソーシャルエンジニアリングに対する防護の比重が高かったのが、最近はAIのせいで古典的なスキャナぶん回すのが逆に効率良くなってしまって、再びアプリケーション層で守るものが増えてしまった感がある
非侵襲BCIキャップのSabiがシードで$50M調達【続報】
- ニット帽型の非侵襲BCI Sabi Capを開発するSabiに関する続報です
- 脳信号をAIへのプロンプトに変える技術の開発に向け、シードラウンドで5000万ドルを調達しました
- 最大10万個のセンサーとTSMC製の独自EEGチップ、10万時間の神経データで学習したBrain Foundation Modelを使います
- 入力前に次の3〜4打鍵を予測できるとされ、考えるだけでAIエージェントと対話する未来像が注目されています
Chubby♨️: (翻訳) Sabiは、話そうとした言葉をテキストに変える帽子を作るため5000万ドルを調達したと発表。頭皮に触れずに脳信号を読む独自EEGチップはTSMCが製造したという。神経データで独自のBrain Foundation Modelも学習しているRahul Chhabra: we've raised $50M from Khosla Ventures, Accel, Initialized, Kevin Weil, DST Global to build the world's most wearable BCI cap at Sabi read more here: https://t.co/5onHFJnEXU
Rohan Paul: (翻訳) Sabiは脳信号をAIモデルへのプロンプトに変える野球帽を作るため、5000万ドルのシードラウンドを調達。帽子には1〜5mmのセンサーを最大10万個搭載でき、10万時間のラベル付き神経記録で学習した脳基盤モデルに入力されるRahul Chhabra: we've raised $50M from Khosla Ventures, Accel, Initialized, Kevin Weil, DST Global to build the world's most wearable BCI cap at Sabi read more here: https://t.co/5onHFJnEXU
Alvaro Cintas: (翻訳) Neuralinkのステップ1は脳手術。Sabiのステップ1は帽子をかぶること。Sabiは非侵襲版を作るため5000万ドルを調達。脳信号から、入力する前に次の3〜4打鍵を予測することもできるRahul Chhabra: we've raised $50M from Khosla Ventures, Accel, Initialized, Kevin Weil, DST Global to build the world's most wearable BCI cap at Sabi read more here: https://t.co/5onHFJnEXU
Tinkerが最大70%値下げ、長文脈RLを効率化
- ファインチューニング基盤Tinkerが効率改善を反映し、最大70%の値下げを発表しました
- 長文脈RLのスケールに対応するための改善で、GLM-5.3-FlashとDeepSeek-v4.1-Flashも利用可能になっています
- オープンモデルで長文脈の強化学習を試したい開発者にとってコスト面の障壁が下がります
Soumith Chintala: (翻訳) エンジニアが頑張ってくれたので、その節約分をお客様に還元します。買えば買うほどお得!(引用: Tinkerの効率を大幅に改善し、長文脈RLをサポートするため最大70%値下げ。GLM-5.3-FlashとDeepSeek-v4.1-Flashも提供開始)Tinker: Tinkerers have been busy scaling up long-context RL! We’ve made significant improvements to Tinker’s efficiency to support those, and are passing these on with price cuts up to 70%. GLM-5.3-Flash and...
DGX SparkでのSpeculative Decodingを解説したZenn記事
- DGX SparkでローカルLLMを動かす際のSpeculative Decodingを調べたZenn記事が公開されました
- Dflashなどを使わないと遅すぎて実用的でないという体験から出発し、仕組みを掘り下げています
- 以前の記事で扱った棄却サンプリングとのつながりも解説されており、推論高速化の理解に役立ちます
asap: DGX SparkでローカルLLMを使っていると、DflashなどのSpeculative Decoding使わないと遅すぎてまともに使えないなとなり どんなものか調べてたら、昔記事にした棄却サンプリングとも繋がってて面白かったので、久々に記事を書きました。 https://t.co/Bm1LnEVFnp #zenn
常時稼働エージェントの仕組みを解説したStanford講義
- Lee Robinson氏が、Stanford CS146Sで常時稼働・プロアクティブ型エージェントの仕組みを講義した動画を公開しました
- モデルの変化、常時稼働エージェントの内部、ハーネス、コンテキストエンジニアリング、今後の方向性をチャプター別に扱っています
- エージェント設計の全体像を短時間で把握したい開発者向けの教材として注目を集めています
Lee Robinson: (翻訳) @Botのような常時稼働でプロアクティブなエージェントはどう動くのか?Stanford CS146Sでの私の講義をご覧ください。2:35 ここまでの経緯 6:13 モデルで何が変わったか 10:06 常時稼働エージェントの内部 18:07 ハーネス 27:26 コンテキストエンジニアリング 34:26 今後の方向性