|
|
||
|---|---|---|
| .. | ||
| README.md | ||
README.md
マルチモーダルネットワーク
トランスフォーマーモデルがNLPタスクを解決する上で成功を収めた後、同様のアーキテクチャがコンピュータビジョンタスクにも適用されてきました。視覚と自然言語の機能を組み合わせるモデルの構築に対する関心が高まっています。そのような試みの一つがOpenAIによって行われ、CLIPおよびDALL.Eと呼ばれています。
対照的画像事前学習 (CLIP)
CLIPの主なアイデアは、テキストプロンプトと画像を比較し、画像がプロンプトにどれだけ一致するかを判断できることです。
このブログ記事からの画像です this blog post
モデルは、インターネットから取得した画像とそのキャプションでトレーニングされています。各バッチについて、N対の(画像、テキスト)を取得し、それらをいくつかのベクトル表現に変換します。これらの表現は互いにマッチングされます。損失関数は、1対(例:IとT)に対応するベクトル間のコサイン類似度を最大化し、他のすべてのペア間のコサイン類似度を最小化するように定義されています。これがこのアプローチが対照的と呼ばれる理由です。
CLIPモデル/ライブラリはOpenAI GitHubから入手できます。このアプローチはこのブログ記事で説明されており、この論文でより詳細に記載されています。
このモデルが事前学習されると、画像のバッチとテキストプロンプトのバッチを与えることができ、確率を持つテンソルを返します。CLIPは以下のいくつかのタスクに使用できます。
画像分類
たとえば、画像を猫、犬、人間に分類する必要があるとします。この場合、モデルに画像と一連のテキストプロンプト("猫の写真", "犬の写真", "人間の写真")を与えます。得られた3つの確率のベクトルの中から、最も高い値を持つインデックスを選択するだけです。
このブログ記事からの画像です this blog post
テキストベースの画像検索
逆に、画像のコレクションを持っている場合、このコレクションをモデルに渡し、テキストプロンプトを与えることで、与えられたプロンプトに最も類似した画像を取得できます。
✍️ 例: CLIPを使用した画像分類と画像検索
CLIPの実行を確認するには、Clip.ipynbノートブックを開いてください。
VQGAN+ CLIPによる画像生成
CLIPは、テキストプロンプトから画像生成にも使用できます。これを行うには、いくつかのベクトル入力に基づいて画像を生成できる生成モデルが必要です。そのようなモデルの一つがVQGAN(ベクトル量子化GAN)と呼ばれています。
VQGANが通常のGANと異なる主なアイデアは次の通りです:
- 自己回帰トランスフォーマーアーキテクチャを使用して、画像を構成する文脈に富んだ視覚部分のシーケンスを生成します。これらの視覚部分は、CNNによって学習されます。
- 画像の部分が「本物」か「偽物」であるかを検出する部分画像判別器を使用します(従来のGANの「全か無か」アプローチとは異なります)。
VQGANについて詳しくは、Taming Transformersのウェブサイトで学ぶことができます。
VQGANと従来のGANの重要な違いの一つは、後者が任意の入力ベクトルから適切な画像を生成できるのに対し、VQGANは一貫性のない画像を生成する可能性が高いことです。したがって、画像生成プロセスをさらにガイドする必要があり、それはCLIPを使用して行うことができます。
テキストプロンプトに対応する画像を生成するために、まずランダムなエンコーディングベクトルを用意し、それをVQGANに通して画像を生成します。次に、CLIPを使用して、画像がテキストプロンプトにどれだけ一致するかを示す損失関数を生成します。目標は、この損失を最小化し、バックプロパゲーションを使用して入力ベクトルのパラメータを調整することです。
VQGAN+CLIPを実装した優れたライブラリはPixrayです。
![]() |
![]() |
![]() |
|---|---|---|
| プロンプト"若い男性の文学教師が本を持っている水彩画のクローズアップポートレート"から生成された画像 | プロンプト"若い女性のコンピュータサイエンス教師がコンピュータを持っている油彩画のクローズアップポートレート"から生成された画像 | プロンプト"黒板の前にいる老年男性数学教師の油彩画のクローズアップポートレート"から生成された画像 |
画像はDmitry Soshnikovによる人工教師コレクションからのものです。
DALL-E
DALL-E 1
DALL-Eは、プロンプトから画像を生成するように訓練されたGPT-3のバージョンです。120億のパラメータで訓練されています。
CLIPとは異なり、DALL-Eはテキストと画像をトークンの単一ストリームとして受け取ります。そのため、複数のプロンプトから、テキストに基づいて画像を生成することができます。
DALL-E 2
DALL-E 1と2の主な違いは、よりリアルな画像とアートを生成することです。
DALL-Eによる画像生成の例:
![]() |
![]() |
![]() |
|---|---|---|
| プロンプト"若い男性の文学教師が本を持っている水彩画のクローズアップポートレート"から生成された画像 | プロンプト"若い女性のコンピュータサイエンス教師がコンピュータを持っている油彩画のクローズアップポートレート"から生成された画像 | プロンプト"黒板の前にいる老年男性数学教師の油彩画のクローズアップポートレート"から生成された画像 |
参考文献
- VQGAN論文: 高解像度画像合成のためのトランスフォーマーの調整
- CLIP論文: 自然言語監視からの転送可能な視覚モデルの学習
免責事項:
この文書は、機械ベースのAI翻訳サービスを使用して翻訳されました。正確性を追求していますが、自動翻訳には誤りや不正確さが含まれる可能性があることをご承知おきください。原文の母国語の文書が権威ある情報源と見なされるべきです。重要な情報については、専門の人間による翻訳を推奨します。この翻訳の使用によって生じる誤解や誤訳について、当社は責任を負いません。








