
何が起きたか
Qwenは2026年9月20日、7Bの生成トランスフォーマー、32層、デフォルト2048×2048、入出力4チャネルのVAEを備えたQwen-Image-2.1を公開した。
なぜ重要か
色と透明をまとめて扱えるため、新規アセット制作では背景除去工程を省ける可能性がある。ただし元の色を厳密に保つ用途での代替にはならないと本文は注記する。
注目点
公開重みは研究・評価限定ライセンスで商用には別ライセンスが必要。7Bは生成トランスフォーマー単体の数字でパイプライン全体ではない。
誰に効くか現在は背景を生成して切り抜いているデザイナー、アセット制作チーム、写真レタッチ担当は、その工程を1ステップに集約できる可能性がある。一方、既存の商品写真を切り抜く場合には元の色を正確に保つためマスクベースの手法が依然必要だ。
こういう要約が、毎朝あなたのメールに届きます。
Qwen-Image-2.1は2026年9月20日に登場した。公開資料から見えてくる面白さは新しいベンチマークスコアではなく、透明性がモデルのどこに位置するかにある。VAE設定には「in_channels」:4と「out_channels」:4が記載され、潜在表現は64チャネルで空間圧縮は16倍だ。本文はさらにMixed-Granularity Attention設計にも触れており、テキストと条件画像のトークンは固定のt=0を取る一方、生成ターゲットは現在のタイムステップを使う。これによりデフォルトの40推論ステップを通じて参照側の計算をキャッシュできる。
記事はこれを、透明性に関する別の伝統と対比させている。BiRefNetのようなマスク推定モデルは前景マスクを推定し、putalphaで元のピクセルに適用するため、デコードされたRGBが残る。4チャネルVAEは代わりに色とアルファを一緒に生成する。これはアセットがまだ存在しない場合には有用だが、既存の写真を忠実に保つこととは同じではない。著者はマスク作業にも当てはまる限界も指摘する。写真はすでに輪郭に背景色が混ざっていることがあるため、RGBを正確に保つこととエッジの色にじみを除去することを無条件に同時に求めることはできない。
これがアセットパイプラインを変えるかどうかは、画質よりもライセンスとメモリにかかっていそうだ。公開重みはQwen Research Licenseの下にあり、商用利用には別ライセンスが必要で、7Bという数字は生成トランスフォーマー単体に当てはまる。Qwen3-VL 8BテキストエンコーダとVAEも同時にロードされるためだ。切り替えを検討するチームは目標解像度でのピークメモリを判断する必要があり、本文はキャッシュ設計による速度倍率は測定なしには述べられないと警告している。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
Nous Researchは評価額15億ドルで9000万ドルのシリーズBを調達

Nvidia出資のReflection AIとMistralが今週、新たなオープンソースモデル「Beam」と「Le Chonk」を発表し、他を上回ると主張した

Liquid AIがd1-3Bを公開

GoogleはブラウザベースのAIプラットフォーム「Playground」を公開

Googleは、画像・動画・音声がAI生成かどうかをSynthIDで判定する新たな公開サイトを立ち上げた

Google DeepMindのgoogle/embeddinggemma-2をGoogle Colab無料版で動かし、日本語「猫の写真」で猫画像が2位(0.7149)、「宇宙へ飛んでいくロケット」でrocket画像が2…
