|
|
||
|---|---|---|
| .. | ||
| README.md | ||
README.md
Rangkaian Multi-Modus
Selepas kejayaan model transformer untuk menyelesaikan tugas NLP, seni bina yang sama atau serupa telah diterapkan pada tugas penglihatan komputer. Terdapat minat yang semakin meningkat dalam membina model yang akan menggabungkan kemampuan penglihatan dan bahasa semula jadi. Salah satu usaha tersebut telah dilakukan oleh OpenAI, dan ia dipanggil CLIP dan DALL.E.
Pra-Latihan Imej Kontrastif (CLIP)
Idea utama CLIP adalah untuk dapat membandingkan arahan teks dengan imej dan menentukan sejauh mana imej tersebut sepadan dengan arahan tersebut.
Gambar dari post blog ini
Model ini dilatih menggunakan imej yang diperoleh dari Internet dan kapsyen mereka. Untuk setiap batch, kita mengambil N pasangan (imej, teks), dan menukarnya kepada beberapa representasi vektor I dan T. Representasi tersebut kemudian dipadankan bersama. Fungsi kehilangan ditentukan untuk memaksimumkan kesamaan kosinus antara vektor yang sepadan dengan satu pasangan (contohnya, I dan T), dan meminimumkan kesamaan kosinus antara semua pasangan lain. Itulah sebabnya pendekatan ini dipanggil kontrastif.
Model/perpustakaan CLIP boleh didapati dari OpenAI GitHub. Pendekatan ini diterangkan dalam post blog ini, dan dengan lebih terperinci dalam kertas ini.
Setelah model ini dilatih, kita boleh memberikannya satu batch imej dan satu batch arahan teks, dan ia akan mengembalikan tensor dengan kebarangkalian. CLIP boleh digunakan untuk beberapa tugas:
Klasifikasi Imej
Katakan kita perlu mengklasifikasikan imej antara, katakan, kucing, anjing dan manusia. Dalam kes ini, kita boleh memberikan model imej, dan satu siri arahan teks: "gambar kucing", "gambar anjing", "gambar manusia". Dalam vektor kebarangkalian yang terhasil, kita hanya perlu memilih indeks dengan nilai tertinggi.
Gambar dari post blog ini
Carian Imej Berdasarkan Teks
Kita juga boleh melakukan sebaliknya. Jika kita mempunyai koleksi imej, kita boleh menghantar koleksi ini kepada model, dan satu arahan teks - ini akan memberikan kita imej yang paling serupa dengan arahan yang diberikan.
✍️ Contoh: Menggunakan CLIP untuk Klasifikasi Imej dan Carian Imej
Buka notebook Clip.ipynb untuk melihat CLIP beraksi.
Penjanaan Imej dengan VQGAN+ CLIP
CLIP juga boleh digunakan untuk penjanaan imej daripada arahan teks. Untuk melakukan ini, kita memerlukan model penjana yang akan dapat menjana imej berdasarkan beberapa input vektor. Salah satu model tersebut dipanggil VQGAN (Vector-Quantized GAN).
Idea utama VQGAN yang membezakannya daripada GAN biasa adalah seperti berikut:
- Menggunakan seni bina transformer autoregressive untuk menjana urutan bahagian visual yang kaya konteks yang membentuk imej. Bahagian visual tersebut seterusnya dipelajari oleh CNN
- Menggunakan diskriminator sub-imej yang mengesan sama ada bahagian imej adalah "nyata" atau "palsu" (berbeza dengan pendekatan "semua atau tiada" dalam GAN tradisional).
Ketahui lebih lanjut tentang VQGAN di laman web Taming Transformers.
Salah satu perbezaan penting antara VQGAN dan GAN tradisional adalah bahawa yang terakhir boleh menghasilkan imej yang baik daripada mana-mana vektor input, sementara VQGAN kemungkinan besar akan menghasilkan imej yang tidak koheren. Oleh itu, kita perlu membimbing proses penciptaan imej lebih lanjut, dan itu boleh dilakukan menggunakan CLIP.
Untuk menjana imej yang sepadan dengan arahan teks, kita bermula dengan beberapa vektor pengkodan rawak yang dihantar melalui VQGAN untuk menghasilkan imej. Kemudian CLIP digunakan untuk menghasilkan fungsi kehilangan yang menunjukkan sejauh mana imej tersebut sepadan dengan arahan teks. Matlamatnya adalah untuk meminimumkan kehilangan ini, menggunakan pembalikan propagasi untuk menyesuaikan parameter vektor input.
Satu perpustakaan hebat yang mengimplementasikan VQGAN+CLIP adalah Pixray
Gambar dari koleksi Guru Tiruan oleh Dmitry Soshnikov
DALL-E
DALL-E 1
DALL-E adalah versi GPT-3 yang dilatih untuk menjana imej daripada arahan. Ia telah dilatih dengan 12 bilion parameter.
Berbeza dengan CLIP, DALL-E menerima kedua-dua teks dan imej sebagai satu aliran token untuk kedua-dua imej dan teks. Oleh itu, daripada pelbagai arahan, anda boleh menjana imej berdasarkan teks.
DALL-E 2
Perbezaan utama antara DALL-E 1 dan 2 adalah bahawa ia menghasilkan imej dan seni yang lebih realistik.
Contoh penjanaan imej dengan DALL-E:
Rujukan
- Kertas VQGAN: Taming Transformers for High-Resolution Image Synthesis
- Kertas CLIP: Learning Transferable Visual Models From Natural Language Supervision
Penafian:
Dokumen ini telah diterjemahkan menggunakan perkhidmatan terjemahan berasaskan AI. Walaupun kami berusaha untuk ketepatan, sila ambil perhatian bahawa terjemahan automatik mungkin mengandungi ralat atau ketidakakuratan. Dokumen asal dalam bahasa asalnya harus dianggap sebagai sumber yang sah. Untuk maklumat penting, terjemahan manusia profesional disyorkan. Kami tidak bertanggungjawab atas sebarang salah faham atau salah tafsir yang timbul daripada penggunaan terjemahan ini.








