メインコンテンツへスキップ

Fresh AI updates

GTIGが報告したOIDC窃取と署名付き悪性パッケージ

GTIGが報告したMCPサーバー経由の侵入と、盗んだOIDCトークンによる署名付き悪性パッケージの配布を整理します。Images 2.5の画像編集、Meta Museの米国展開、AgentCoreのCI評価、CUDA Rustの開発段階も確認し、導入時に見極めたい機能と制約をまとめます。

22分で読めます
GTIGが報告したOIDC窃取と署名付き悪性パッケージ

3分で読む AIダイジェスト 20260909

GTIGは、MCPサーバーを悪性化して配布する侵入事例と、盗んだOIDCトークンで有効な署名付き悪性パッケージを公開する手口を報告しました。署名が有効でも、配布物の安全性までは保証されません。一方、Images 2.5は画像の部分編集と反復編集を改善し、Meta MuseはWeb操作や購入を代行する個人向けエージェントとして米国展開を始めています。

読者まず見ること
管理者パッケージ署名の検証と、公開元アカウント・CIの侵害調査を分けて確認します。Museの現行VMと年内予定の暗号化機能も区別が必要です。
AX担当Images 2.5の部分編集で、変更していない商品・文字・構図が維持されるかを実素材で比較します。
エンジニアAgentCoreのCIサンプルが省略する利用者の権限テストと、CUDA Rustの両方式がまだ本番向けではない点を確認します。

GTIG AI Threat Tracker: From Prompting to Autonomy – The Evolution of Adversarial AI

署名の検証だけでは見抜けない、配布経路の侵害が焦点です。

何が変わったか: AI開発環境を狙うMCPサーバーの悪性化と、CIの認証情報を盗んで正規の配布手続きを悪用する事例が報告されました。

Google Threat Intelligence Groupによると、UNC6780は正規の開発者アカウントを侵害し、悪性コードを仕込んだMCPサーバーのフォークをPyPIへ公開しました。DUSTMAKERはGitHub ActionsランナーからOIDCトークンを盗み、有効な署名付きSLSA Build Level 3の来歴証明を伴う悪性パッケージの公開に利用しました。LLMセキュリティスキャナーを妨げるプロンプトインジェクションも報告されています。

同じ報告にある「6時間未満」は、別の金銭目的の攻撃者が、侵害済みクラウド環境で認証情報収集を計画・構築・実行するまでの時間です。OIDC窃取の検知期限や、上記の配布攻撃全体の所要時間ではありません。

実装・運用観点: 署名は確認すべき情報ですが、公開元アカウントやCIが侵害されれば、署名付きの配布物も悪性化します。MCPサーバーと依存パッケージの変更内容、公開元の侵害情報、CIのOIDC権限を併せて点検する必要があります。LLMスキャナーだけに依存せず、静的解析や隔離実行も重ねる判断につながる事例です。

認証情報と実行権限の分離に加え、検査対象のコードに埋め込まれたプロンプトインジェクションを検査側が指示として扱わない設計も確認点です。

確認論点:

  • MCPサーバーとPyPI依存関係の配布元・ハッシュ・固定バージョンを確認する
  • GitHub ActionsのOIDCトークン権限と有効期間、失効手順を確認する
  • LLMスキャナー以外の静的解析と隔離実行を併用しているか確認する

未確認事項:

  • 観測事例全体の件数と被害規模は公表されていない
  • 自組織で該当パッケージや派生版を取り込んでいるかは、依存関係の棚卸しが必要

あわせて見る動き

主要論点の背景、比較材料、運用上の影響を補う更新です。

  • 掲載件数: 6件
  • 対象分野: OpenSource(1件) / Infra(1件) / Products(4件)
  • 関係する読者: AX担当 / エンジニア / 管理者

Introducing CUDA Rust: Two Tracks for Writing GPU Kernels

何が変わったか: RustによるCUDAカーネル開発で、低水準制御とコンパイラ主導の記述を用途別に選べる二つの公式経路が加わりました。

NVIDIAは、RustでGPUカーネルを書くCUDA Rustとして、スレッド単位で制御するSIMT方式のcuda-oxideと、タイル単位で記述するcutile-rsを公開しました。cuda-oxideはnightly版RustからPTXへコンパイルし、cutile-rsは安定版Rust上で初回実行時にJITコンパイルします。NVIDIAはTileを先に検討し、メモリやスレッドの直接制御が必要な場合にSIMTを使う方針を示しています。

実装・運用観点: NVIDIAは両方式とも本番利用向けではないと明記しています。cuda-oxideは初期アルファ段階で、cutile-rsが安定版Rustを使うことも、ライブラリ自体の成熟を意味しません。既存CUDA C++実装と比較する試験用途から検討する段階です。

確認論点:

  • 対象カーネルでTileとSIMTのどちらの制御粒度が必要か確認する
  • nightly版Rustまたは初回JITをビルド・配備工程で許容できるか確認する
  • 既存CUDA C++実装と同一条件で性能と正確性を測定する

未確認事項:

  • cuda-oxideが安定版に至る時期は示されていない
  • 両方式を横断した性能比較値は公表されていない

Automated agent evaluation with Amazon Bedrock AgentCore and GitHub Actions

何が変わったか: エージェントの実行履歴をCIで評価し、回帰時にマージを止める具体的なAgentCore運用経路が示されました。

AWSは、GitHub Actionsから開発環境へエージェントを配備し、AgentCore Evaluate APIで評価して、スコアが閾値を下回る場合にPRを失敗させる品質ゲートの実装例を公開しました。評価対象はOpenTelemetryトレースで、組み込み評価器、カスタムLLM判定、Lambda、第三者製評価器を利用できます。例示されたM2Mトークンは役割情報を持たず、MCPツールの役割チェックを設計上迂回します。

実装・運用観点: このサンプルのM2M経路は利用者の役割チェックを省略する設計なので、品質評価の合格を権限検証の合格と見なすことはできません。利用者コンテキストを持つテストを別に用意する必要があります。AWSが示す一連の処理時間の目安は約10分で、4評価器×5プロンプトならLLM判定は20回です。

実行経路を追えるトレースを残すことと、評価器で成否を判断することは別の工程です。保存したトレースを評価する方法なら、エージェントを再配備せず評価器を試せます。

確認論点:

  • 評価閾値を自組織の失敗許容度と評価データから設定する
  • 評価失敗時の再試行回数と手動承認経路を決める
  • M2Mトークンと利用者コンテキストの権限テストを分離する

未確認事項:

  • 自社の評価データ・モデルでの実行時間と費用は別途測定が必要
  • 例示された0.8は一般的な推奨閾値ではない

Power agent hubs or custom harnesses with the Antigravity SDK in one toolkit

何が変わったか: Antigravity SDKを使い、独自の監視画面に実行状況やツールの承認処理を組み込む方法が紹介されました。SDK自体の新規リリースを告知する記事ではありません。

Google Cloudは、Antigravity 2.0およびAntigravity CLIと同じ実行エンジンをアプリへ組み込むAntigravity SDKを紹介しました。SDKはファイル操作の隔離、ライフサイクルフックによる介入、会話ID単位の実行履歴・ツール結果・成果物の永続化を提供します。ツール実行前フックでは、ツール名と引数を監視側へ送り、許可または拒否できます。

実装・運用観点: ツール名と引数を確認して実行前に止める処理を、独自画面から組み込める例です。掲載コードは許可を返す最小例なので、実際の承認待ち、拒否後の状態、接続が切れた場合の扱いは実装側で補う必要があります。

確認論点:

  • ファイル操作を許可するワークスペース範囲を確認する
  • ツール名と引数を基にした承認・拒否ルールを定義する
  • 会話状態と成果物の保存先、保持期間、削除方法を確認する

未確認事項:

  • 一般提供・プレビュー区分、価格、SLAは明示されていない
  • 紹介された独自監視画面の承認待ち・切断時の挙動は、実装ごとの検証が必要

Muse: Meta's personal AI agent, features and capabilities

何が変わったか: 記憶、Web操作、決済までを連結する個人向けエージェントが、専用実行環境と購入単位の決済制約を伴って提供されます。

Metaは、長期目標を記憶し、提案やWeb操作を行う個人向けエージェントMuseを米国で展開すると発表しました。Museはエージェントと利用者データを格納する専用仮想マシンMuse Secure VM上で動作します。Stripe Linkとの連携では、承認された購入に限定した使い捨て仮想カードも利用できます。

実装・運用観点: Metaによると、Museとは別のSentinelがインターネットへの操作を承認し、メール送信や購入では利用者の許可を求めます。使い捨てカードで実カードの情報を見せない仕組みも特徴です。一方、利用者だけが持つ鍵でVM全体を暗号化するMuse Confidential VMは年内予定で、現行Secure VMとは分けて評価する必要があります。

AI Agentが操作を選ぶ処理とは別に、実行を許可する権限境界を置く構成として読むと、Sentinelの役割が分かりやすくなります。

確認論点:

  • 購入承認の対象、金額、加盟店、失効条件を確認する
  • 接続サービスごとの権限と解除後のデータ削除を確認する
  • 現行Secure VMと将来のConfidential VMを混同しない

未確認事項:

  • 現行Secure VMのデータ保持・削除条件は導入前に追加確認が必要
  • Muse Confidential VMの提供日と対象地域は未発表

Agentic analytics with the Data Agent Kit

何が変わったか: プレビュー中のData Agent Kitで、複数データソースの調査からdbtモデルの作成・テスト修正まで進める活用例が公開されました。

Google CloudのData Agent Kitは、MCPサーバーとエージェントスキルを組み合わせ、IDEからBigQuery、Cloud SQL、Cloud Storageなどを横断して調査するツール群です。MCPツールの実行前にIDEが権限確認で停止し、実行履歴からツール呼び出しや送信したSQLを確認できます。現在はプレビューです。

実装・運用観点: 読み取り専用SQLでも、対象データ、クエリ費用、結果の持ち出し範囲を権限確認に含める必要があります。「常時許可」を選べるため、接続先や操作別に承認を再要求する条件を決めたいところです。

ツールが実行できる操作範囲と、接続先データへの権限は分けて確認します。IDEでの承認だけで、データベース側のアクセス制御を代替できるわけではありません。

確認論点:

  • 接続先ごとに読み取り・書き込み権限を分離する
  • 常時許可の適用範囲と取り消し方法を確認する
  • 送信SQL、ツール結果、修正履歴の保存先を確認する

未確認事項:

  • プレビュー終了時期、料金、SLAは示されていない
  • 各接続先で可能な書き込み操作の全範囲は不明

ChatGPT Images 2.5の部分編集と2つのAPIモデル

何が変わったか: OpenAIはImages 2.5の展開を始め、画像内へのコメント、スケッチを使った指示、テンプレートを追加しました。APIにはGPT-Image-2.5 FlareとGPT-Image-2.5 Sunburstが加わります。

OpenAIは、指定部分だけを変更する精密な編集と、複数回の編集でも過去の変更を維持する一貫性の改善を報告しています。Flareは速度を重視する用途、Sunburstは生成時間が長くても細部の精度を重視する用途に位置付けています。ChatGPT、ChatGPT Work、Codexの全プランで展開を開始し、両モデルはAPIでも提供されます。

実装・運用観点: 商品写真の背景や文字だけを直す工程では、修正箇所以外が維持されるかが重要です。同じ素材を繰り返し編集し、商品形状・文字・構図の変化を比較すると採用判断に使えます。Images 2.0比で最大50%の生成遅延削減はOpenAIの公表値で、独立した再現結果ではありません。

確認論点:

  • 部分編集を重ねても、変更対象外の商品・文字・構図が維持されるか比較する
  • FlareとSunburstを同じ素材・指示で試し、待ち時間と修正回数を測る

未確認事項:

  • 日本語を含む自社素材での編集品質と、用途別の実効コストは未検証

短く追う更新

優先度は少し下がりますが、流れを押さえるために確認しておきたい更新です。

  • 掲載件数: 9件
  • 対象分野: Infra(4件) / Research(1件) / Business(3件) / Products(1件)
  • 関係する読者: AX担当 / エンジニア / 管理者

How HPE Zerto built an agentic troubleshooting system with Amazon Bedrock

  • 情報源: AWS / HPE Zerto
  • 出典種別: 公式情報
  • 分類: Infra
  • 関係する読者: 管理者 / AX担当 / エンジニア

HPE Zertoは、Strands Agentsによるエージェントをオンプレミス製品内のPodで動かし、推論をAmazon Bedrock、ナレッジ検索をBedrock Knowledge Basesへ送る構成を紹介しました。テレメトリもCloudWatchへ送信します。ZVMとVRAの専門エージェントは独立したコンテキストで調査し、親には要約を返します。エージェントがオンプレミスで動くことと、ログ由来の情報が外へ出ないことは同義ではありません。

変化: ローカルのツール・履歴とクラウド推論を組み合わせた障害調査の実装例が示されました。 確認: 推論要求とテレメトリに含まれるログ・機微情報を確認する

Amazon SageMaker Feature Store introduces UpdateRecord for feature-level writes

  • 情報源: AWS
  • 出典種別: 公式情報
  • 分類: Infra
  • 関係する読者: AX担当 / エンジニア

SageMaker Feature StoreのUpdateRecord APIは、指定した特徴量だけを既存レコードへ原子的に統合し、指定していない値を維持します。最大100特徴量を指定できますが、既存レコードが必要で、新規作成を兼ねるupsertではありません。EventTimeも更新する場合、既存値より新しくなければHTTP 409で拒否されます。Standard層ではStandard_V2形式が必要です。

変化: 全レコードの読み出し・統合・書き戻しをせず、競合を抑えながら特徴量単位で更新できるようになりました。 確認: 既存レコードがない場合のPutRecord経路を用意する

AlphaGenome Atlas: A predictive map of every possible DNA letter change in the human genome

  • 情報源: Google DeepMind
  • 出典種別: 公式情報
  • 分類: Research
  • 関係する読者: 管理者 / AX担当 / エンジニア

Google DeepMindは、ヒトゲノムで可能な約90億の一塩基変異について分子影響を事前計算したAlphaGenome Atlasを公開しました。約1PBのデータセットで、AlphaGenome Variant Impactスコアによる変異の優先順位付けを支援します。非商用研究向けにWebポータルとAPIを提供し、臨床用途では検証・承認されていないと明記しています。

変化: 個別にモデル推論を実行せず、約90億変異の予測と統合スコアを検索・取得できる研究資源が加わりました。 確認: 研究用途と臨床判断の責任境界を明示する

Mistralが主権AIとオープンウェイトモデルの開発へ30億ユーロを調達

  • 情報源: Mistral AI
  • 出典種別: 公式情報
  • 分類: Business
  • 関係する読者: 管理者 / AX担当

MistralはシリーズDで30億ユーロを調達し、調達後評価額が210億ユーロ超になったと発表しました。Samsung Electronicsが主導し、Scaleup Europe FundとPSG Equityが共同主導しています。資金は計算能力、インフラ、商業成長、国際展開の拡大に充てる方針です。

変化: 欧州の主権AIを掲げるMistralが、計算資源と国際展開を大幅に拡張できる資本を確保しました。 確認: 自組織のデータ所在・準拠法要件と提供地域を照合する

How KDDI built Buffmee, a faster, reliable consumer RAG app

  • 情報源: Google Cloud
  • 出典種別: 公式情報
  • 分類: Products
  • 関係する読者: 管理者 / AX担当 / エンジニア

Google CloudとKDDIの事例では、100超の情報源を参照するRAGサービスBuffmeeについて、応答遅延を38%削減し、最初のトークンまでの時間を約18%改善したと報告しています。評価指標の一部を二値判定へ変え、代表サンプルを選ぶことで評価作業量を75%削減しました。800行超のシステムプロンプトは機能別のADK Skillsへ分割しています。

変化: 大規模プロンプトの分割と評価データの層別選定を組み合わせ、RAGの遅延と評価負荷を改善した運用例が示されました。

RAGの検索と生成を分けた評価に、実行経路の遅延分析を組み合わせた事例です。 確認: スキル選択結果と読み込んだ指示を記録する

Benchmarking small LLM inference on SageMaker AI: G7 vs G5 and G6

  • 情報源: AWS
  • 出典種別: 公式情報
  • 分類: Infra
  • 関係する読者: 管理者 / AX担当 / エンジニア

AWSはQwen3-Coder-30B-A3B-Instruct-FP8を同一コンテナとワークロードでG5、G6、G7上に配備して比較しました。100リクエスト、同時実行4、平均入出力各128トークンの条件では、G7が391.3出力トークン毎秒、平均遅延1,315.8ミリ秒でした。結果はモデル、量子化、トークン分布、同時実行数に依存すると明記されています。

変化: G7を含む三世代のGPU推論性能を、再現可能な条件付きで比較する判断材料が公開されました。

確認: 実際の入力・出力長と同時実行数で再測定し、対話用途では最初のトークンまでの時間も測る

Govern models with MLflow and Amazon SageMaker AI Model Registry sync: Part 1

  • 情報源: AWS
  • 出典種別: 公式情報
  • 分類: Infra
  • 関係する読者: 管理者 / AX担当 / エンジニア

Managed MLflowからSageMaker AI Model Registryへの同期で、学習・評価指標、推論仕様、モデル系譜をModel Packageへ転送できるようになりました。MLflowのエイリアスからSageMaker側のライフサイクル段階を更新できます。同期はオプトインで、IAM条件キーによる本番昇格制限とEventBridgeの監査記録にも対応します。

変化: 二つのモデル台帳間で登録情報だけでなく、評価根拠、系譜、昇格状態まで同期できるようになりました。 確認: MLflowとSageMakerのどちらを正とするか定義する

1Password increases engineering productivity 21% with Codex

  • 情報源: OpenAI
  • 出典種別: 公式情報
  • 分類: Business
  • 関係する読者: 管理者 / AX担当 / エンジニア

OpenAIと1Passwordの事例では、Codexを継続利用する中核コホートで生産性が20.9%向上し、プルリクエストの中央値サイクル時間が10.9%短縮したと報告しています。リポジトリには平文認証情報ではなくシークレット参照を置き、承認済みツールが実行時に認証情報を注入します。変更は人間のレビュー、受け入れ基準、自動テストと組み合わせています。

変化: コーディングエージェントの効果測定と、平文認証情報をモデルのコンテキストへ入れない実行方式が事例として示されました。

モデルに秘密値を渡さず実行時に解決する方式は、エージェントとツールの権限境界を考える具体例になります。 確認: 利用者選択の偏りを含めた効果測定方法を確認する

AccentureとGoogle CloudがGemini Enterprise専門組織を設立

  • 情報源: Accenture
  • 出典種別: 公式情報
  • 分類: Business
  • 関係する読者: 管理者 / AX担当

AccentureとGoogle Cloudは、Gemini Enterpriseの導入を支援するAccenture Gemini Enterprise Business Groupを設立しました。顧客の現場で実装を支援するエンジニア(FDE)を1,000人規模で配置する計画です。業界別に再利用可能なソリューション、実験から全社展開への移行、利用者定着を重点領域に挙げています。

変化: Gemini Enterpriseの導入支援を、1,000人規模の現場人材と業界別の再利用可能な実装へ組織化する計画が示されました。 確認: 顧客固有部分と再利用可能部分の所有権を確認する

ひとこと更新

本文で詳しく扱うほどではないものの、周辺動向として確認しておきたい話題です。

Written by

柿添貴士(TakashiKakizoe) profile photo

柿添貴士(TakashiKakizoe)

Webエンジニア/テックリード

Fukuoka, Japan

  • PHP
  • Laravel
  • Next.js
  • AWS
  • Cloudflare
  • AI Agent