メインコンテンツへスキップ

Fresh AI updates

Qwen-Image-2.1、7B画像生成部でRGBA生成と編集を統合

Qwen-Image-2.1の7B画像生成部、RGBA画像の生成・編集、最大10枚の参照入力、2K出力を確認し、LangChainの型安全ルーティング、llama.cppのMetal修正、Meta Museのデータ利用境界を整理します。導入時に確認すべきライセンス、実行経路、学習利用設定までまとめます。

8分で読めます
Qwen-Image-2.1、7B画像生成部でRGBA生成と編集を統合

最初に見るべきは、Qwenチームが公開したQwen-Image-2.1だ。7Bパラメータの画像生成部に、通常画像と透過RGBA画像の生成・編集、最大10枚の参照画像、2K出力を統合した。続いて、LangChainの型安全な分類とモデルルーティング、llama.cppで特定条件のMetal演算がCPUへフォールバックしていた問題の修正を確認する。最後に、Meta Museの利用レビューから、接続データ、長期記憶、モデル学習への利用を別々の設定として確認する必要性を整理する。

今日の判断は、単一の機能名やパラメータ数だけで採用可否を決めないことだ。画像生成ならモデル全体の構成とライセンス、分類器なら判断の適用範囲と失敗条件、推論基盤なら実際の実行先、個人エージェントなら接続権限とデータ再利用を、それぞれ受入条件として確認したい。(出典1 / 出典2 / 出典3 / 出典4)

Qwen-Image-2.1、7B画像生成部で透過画像も統合

Qwenチームは2026年9月20日、Qwen-Image-2.1のリポジトリと重みを公開した。画像生成部は32層のsingle-stream DiTで7Bパラメータを持ち、テキストエンコーダーにはQwen3-VL 8B、画像表現には64チャネルのRGBA VAEを使う。したがって、7Bは画像生成部の規模であり、推論系全体の規模ではない。(出典1)

同じパイプラインでテキストからの画像生成と画像編集を扱い、最大10枚の参照画像を使った構成、円やマスクによる局所編集、透過RGBA画像の生成と編集に対応する。公式手順は2K出力を標準例とし、Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2Vによる公開初日からの対応も案内している。(出典1)

リポジトリはQwen Research License Agreementで提供される。利用前には、用途と配布条件が自社要件に合うかを確認する必要がある。公式手順はPyTorch 2.4以降、Transformers 5.17以降、開発版Diffusersを指定しており、モデル重みだけでなく実行依存関係も固定対象になる。(出典1)

EastBraverの見立て: 導入時は「7Bの画像モデル」と短縮せず、テキストエンコーダー、VAE、プロンプト書き換えモデル、推論基盤、ライセンスをAI BOMとして記録したい。透過画像や複数参照の機能確認と同時に、実際のVRAM、待ち時間、出力再現性を自社の画像サイズで測る必要がある。(出典1)

LangChain、型安全な分類とモデルルーティングをalpha公開

LangChainは2026年9月20日、langchain-typesafe==0.0.1a3を公開した。リリースにはTypeSafeClassifier、実験的なAutoModeMiddlewareとModelRouterMiddleware、利用量メタデータのトレース対応が含まれる。(出典1)

a3では、分類器へ渡す質問を呼び出しごとの適用範囲へ閉じる変更も入った。分類条件をmiddlewareインスタンス全体へ固定せず、実行ごとの文脈として扱う方向の変更となる。(出典1)

このパッケージはalpha段階にある。LangChainのissue trackerには、ModelRouterMiddlewareへHumanMessageを含まない状態を渡すと、不透明なRuntimeErrorが起きる報告がある。保存状態からの再開やassistant turnから始まるグラフでも到達し得る条件として報告された。(出典2)

EastBraverの見立て: モデルルーティングでは低価格モデルへ振り分けられるかだけでなく、分類条件の適用範囲、再開時の状態、分類結果と利用量をトレースで追えるかまでを受入条件にしたい。(出典1)

llama.cpp、Metalのhc固定によるCPUフォールバックを解消

llama.cppのプレリリースb11064は、Metalのdsv4_hc_preカーネルでhcを4に固定していた制約を外した。従来は4以外のhcで演算が拒否され、CPUへフォールバックしていた。(出典1)

リリース説明では、Kimi-K3がcross-layer residual stackのbanked checkpoint数をhcとして使い、その値がlayer indexとともに増えることを背景として挙げている。修正ではn_hcをfunction constantとして渡し、値ごとのpipeline variantを用意した。(出典1)

テストにはhc = 1, 2, 3, 5, 8, 65のcaseが追加され、gatedとnon-gatedの双方を対象にした。同じ9月20日のプレリリースでは、b11063でAST中の不正UTF-8 sequence処理、b11062でQwen4向けCUDA sparse flash attentionの有効化も入った。(出典1 / 出典2 / 出典3)

EastBraverの見立て: 推論基盤では対応機能の一覧だけでなく、実際にどの実行基盤へ処理が割り当てられたかを見る必要がある。GPUカーネルが存在しても、特定の入力形状でCPUへフォールバックすれば性能とコストの前提は変わる。実行基盤別の経路を観測できるテストを持つ方が安全だ。(出典1)

  • 出典: llama.cpp b11064(公式情報、2026-09-21 00:19 JST)
  • 関連更新: b11063 / b11062
  • 情報の扱い: いずれもプレリリース

Meta Muse、接続データとモデル学習を分けて確認

WIREDの利用レビューによると、Metaの個人AIエージェントMuseは専用の仮想マシン上でWebを操作し、予約や買い物などを実行できる。Metaの公式説明では、メールなどの接続先を使う処理に対し、接続方法、認証情報、外部通信の許可を別の保護層へ分離している。(出典1 / 出典2)

WIREDがSensor Towerの値として報じたところでは、Museは公開後1週間で90万件を超えてダウンロードされた。Museは利用者とのやり取りや好みをMemory文書へ保存し、利用者は内容を編集したり、チャットから削除を依頼したりできる。一方、記事掲載時点ではMemory機能そのものを無効にする設定は提供されていなかった。(出典1)

Metaは、会話、ツール呼び出し、subagent間の引き継ぎを含む推論データを、新しいモデルの学習に役立てると説明している。個人を特定できる主要情報を除去してから使うとしており、利用者はMuseの設定から学習利用を無効化できる。WIREDは、学習利用が初期設定で有効だと報じた。(出典1 / 出典2)

Metaは、同社自身が仮想マシン内のデータへアクセスできないことを暗号学的に検証可能にするMuse Confidential VMを、2026年内に提供する計画も示している。(出典2)

EastBraverの見立て: 個人エージェントでは、接続先への認可、長期Memory、モデル学習への利用、削除方法を別々の受入項目にしたい。接続を許可したことと、保存や学習への再利用へ同意したことを同じ判断として扱うべきではない。(出典1 / 出典2)

Written by

柿添貴士(TakashiKakizoe) profile photo

柿添貴士(TakashiKakizoe)

Webエンジニア/テックリード

Fukuoka, Japan

  • PHP
  • Laravel
  • Next.js
  • AWS
  • Cloudflare
  • AI Agent