AI-For-Beginners/translations/ms/lessons/X-Extras/X1-MultiModal
Pikachú 5d34bc4eb8 Add support documentation and translations for various lessons 2025-02-12 16:09:04 +00:00
..
README.md Add support documentation and translations for various lessons 2025-02-12 16:09:04 +00:00

README.md

Rangkaian Multi-Modus

Selepas kejayaan model transformer untuk menyelesaikan tugas NLP, seni bina yang sama atau serupa telah diterapkan pada tugas penglihatan komputer. Terdapat minat yang semakin meningkat dalam membina model yang akan menggabungkan kemampuan penglihatan dan bahasa semula jadi. Salah satu usaha tersebut telah dilakukan oleh OpenAI, dan ia dipanggil CLIP dan DALL.E.

Pra-Latihan Imej Kontrastif (CLIP)

Idea utama CLIP adalah untuk dapat membandingkan arahan teks dengan imej dan menentukan sejauh mana imej tersebut sepadan dengan arahan tersebut.

Arsitektur CLIP

Gambar dari post blog ini

Model ini dilatih menggunakan imej yang diperoleh dari Internet dan kapsyen mereka. Untuk setiap batch, kita mengambil N pasangan (imej, teks), dan menukarnya kepada beberapa representasi vektor I dan T. Representasi tersebut kemudian dipadankan bersama. Fungsi kehilangan ditentukan untuk memaksimumkan kesamaan kosinus antara vektor yang sepadan dengan satu pasangan (contohnya, I dan T), dan meminimumkan kesamaan kosinus antara semua pasangan lain. Itulah sebabnya pendekatan ini dipanggil kontrastif.

Model/perpustakaan CLIP boleh didapati dari OpenAI GitHub. Pendekatan ini diterangkan dalam post blog ini, dan dengan lebih terperinci dalam kertas ini.

Setelah model ini dilatih, kita boleh memberikannya satu batch imej dan satu batch arahan teks, dan ia akan mengembalikan tensor dengan kebarangkalian. CLIP boleh digunakan untuk beberapa tugas:

Klasifikasi Imej

Katakan kita perlu mengklasifikasikan imej antara, katakan, kucing, anjing dan manusia. Dalam kes ini, kita boleh memberikan model imej, dan satu siri arahan teks: "gambar kucing", "gambar anjing", "gambar manusia". Dalam vektor kebarangkalian yang terhasil, kita hanya perlu memilih indeks dengan nilai tertinggi.

CLIP untuk Klasifikasi Imej

Gambar dari post blog ini

Carian Imej Berdasarkan Teks

Kita juga boleh melakukan sebaliknya. Jika kita mempunyai koleksi imej, kita boleh menghantar koleksi ini kepada model, dan satu arahan teks - ini akan memberikan kita imej yang paling serupa dengan arahan yang diberikan.

✍️ Contoh: Menggunakan CLIP untuk Klasifikasi Imej dan Carian Imej

Buka notebook Clip.ipynb untuk melihat CLIP beraksi.

Penjanaan Imej dengan VQGAN+ CLIP

CLIP juga boleh digunakan untuk penjanaan imej daripada arahan teks. Untuk melakukan ini, kita memerlukan model penjana yang akan dapat menjana imej berdasarkan beberapa input vektor. Salah satu model tersebut dipanggil VQGAN (Vector-Quantized GAN).

Idea utama VQGAN yang membezakannya daripada GAN biasa adalah seperti berikut:

  • Menggunakan seni bina transformer autoregressive untuk menjana urutan bahagian visual yang kaya konteks yang membentuk imej. Bahagian visual tersebut seterusnya dipelajari oleh CNN
  • Menggunakan diskriminator sub-imej yang mengesan sama ada bahagian imej adalah "nyata" atau "palsu" (berbeza dengan pendekatan "semua atau tiada" dalam GAN tradisional).

Ketahui lebih lanjut tentang VQGAN di laman web Taming Transformers.

Salah satu perbezaan penting antara VQGAN dan GAN tradisional adalah bahawa yang terakhir boleh menghasilkan imej yang baik daripada mana-mana vektor input, sementara VQGAN kemungkinan besar akan menghasilkan imej yang tidak koheren. Oleh itu, kita perlu membimbing proses penciptaan imej lebih lanjut, dan itu boleh dilakukan menggunakan CLIP.

Arsitektur VQGAN+CLIP

Untuk menjana imej yang sepadan dengan arahan teks, kita bermula dengan beberapa vektor pengkodan rawak yang dihantar melalui VQGAN untuk menghasilkan imej. Kemudian CLIP digunakan untuk menghasilkan fungsi kehilangan yang menunjukkan sejauh mana imej tersebut sepadan dengan arahan teks. Matlamatnya adalah untuk meminimumkan kehilangan ini, menggunakan pembalikan propagasi untuk menyesuaikan parameter vektor input.

Satu perpustakaan hebat yang mengimplementasikan VQGAN+CLIP adalah Pixray

Gambar yang dihasilkan oleh Pixray Gambar yang dihasilkan oleh pixray Gambar yang dihasilkan oleh Pixray
Gambar yang dihasilkan dari arahan gambar closeup potret cat air seorang guru lelaki muda dengan sebuah buku Gambar yang dihasilkan dari arahan gambar closeup potret minyak seorang guru wanita muda dengan sains komputer dengan sebuah komputer Gambar yang dihasilkan dari arahan gambar closeup potret minyak seorang guru lelaki tua dengan matematik di hadapan papan hitam

Gambar dari koleksi Guru Tiruan oleh Dmitry Soshnikov

DALL-E

DALL-E 1

DALL-E adalah versi GPT-3 yang dilatih untuk menjana imej daripada arahan. Ia telah dilatih dengan 12 bilion parameter.

Berbeza dengan CLIP, DALL-E menerima kedua-dua teks dan imej sebagai satu aliran token untuk kedua-dua imej dan teks. Oleh itu, daripada pelbagai arahan, anda boleh menjana imej berdasarkan teks.

DALL-E 2

Perbezaan utama antara DALL-E 1 dan 2 adalah bahawa ia menghasilkan imej dan seni yang lebih realistik.

Contoh penjanaan imej dengan DALL-E:

Gambar yang dihasilkan oleh Pixray Gambar yang dihasilkan oleh pixray Gambar yang dihasilkan oleh Pixray
Gambar yang dihasilkan dari arahan gambar closeup potret cat air seorang guru lelaki muda dengan sebuah buku Gambar yang dihasilkan dari arahan gambar closeup potret minyak seorang guru wanita muda dengan sains komputer dengan sebuah komputer Gambar yang dihasilkan dari arahan gambar closeup potret minyak seorang guru lelaki tua dengan matematik di hadapan papan hitam

Rujukan

Penafian:
Dokumen ini telah diterjemahkan menggunakan perkhidmatan terjemahan berasaskan AI. Walaupun kami berusaha untuk ketepatan, sila ambil perhatian bahawa terjemahan automatik mungkin mengandungi ralat atau ketidakakuratan. Dokumen asal dalam bahasa asalnya harus dianggap sebagai sumber yang sah. Untuk maklumat penting, terjemahan manusia profesional disyorkan. Kami tidak bertanggungjawab atas sebarang salah faham atau salah tafsir yang timbul daripada penggunaan terjemahan ini.