AI-For-Beginners/translations/tr/lessons/X-Extras/X1-MultiModal
Pikachú 5d34bc4eb8 Add support documentation and translations for various lessons 2025-02-12 16:09:04 +00:00
..
README.md Add support documentation and translations for various lessons 2025-02-12 16:09:04 +00:00

README.md

Çok Modlu Ağlar

Transformer modellerinin NLP görevlerini çözmedeki başarısının ardından, aynı veya benzer mimariler bilgisayarla görme görevlerine uygulanmıştır. Görsel ve doğal dil yeteneklerini birleştiren modeller oluşturma konusunda artan bir ilgi vardır. Bu tür girişimlerden biri OpenAI tarafından gerçekleştirilmiş olup, CLIP ve DALL.E olarak adlandırılmaktadır.

Karşıt Görüntü Ön Eğitimi (CLIP)

CLIP'in ana fikri, metin istemlerini bir görüntü ile karşılaştırabilmek ve görüntünün istemle ne kadar iyi eşleştiğini belirlemektir.

CLIP Mimarı

Resim bu blog yazısından alınmıştır.

Model, İnternetten elde edilen görüntüler ve bunların başlıkları üzerinde eğitilmektedir. Her bir grup için N (görüntü, metin) çiftini alır ve bunları bazı vektör temsillerine dönüştürür. Bu temsiller daha sonra bir araya getirilir. Kayıp fonksiyonu, bir çift (örneğin I ve T) ile ilgili vektörler arasındaki kosinüs benzerliğini maksimize edecek şekilde tanımlanmıştır ve diğer tüm çiftler arasındaki kosinüs benzerliğini minimize etmektedir. Bu nedenle bu yaklaşım karşıt olarak adlandırılmaktadır.

CLIP modeli/kütüphanesi OpenAI GitHub üzerinden mevcuttur. Yaklaşım bu blog yazısında ve daha ayrıntılı olarak bu makaledeıklanmaktadır.

Bu model önceden eğitildiğinde, ona bir grup görüntü ve bir grup metin istemi verebiliriz ve o da bize olasılıklarla dolu bir tensör döndürecektir. CLIP, çeşitli görevler için kullanılabilir:

Görüntü Sınıflandırması

Diyelim ki, görüntüleri kediler, köpekler ve insanlar arasında sınıflandırmamız gerekiyor. Bu durumda, modele bir görüntü ve bir dizi metin istemi verebiliriz: "bir kedinin resmi", "bir köpeğin resmi", "bir insanın resmi". Sonuçta elde edilen 3 olasılık vektöründe, sadece en yüksek değere sahip olan indeksi seçmemiz yeterlidir.

CLIP ile Görüntü Sınıflandırması

Resim bu blog yazısından alınmıştır.

Metin Tabanlı Görüntü Arama

Aynı zamanda tersini de yapabiliriz. Eğer elimizde bir görüntü koleksiyonu varsa, bu koleksiyonu modele geçirebiliriz ve bir metin istemi - bu, verilen bir isteme en benzer görüntüyü bize verecektir.

✍️ Örnek: CLIP ile Görüntü Sınıflandırma ve Görüntü Arama

CLIP'in uygulamasını görmek için Clip.ipynb defterini açın.

VQGAN+ CLIP ile Görüntü Üretimi

CLIP, bir metin isteminden görüntü üretimi için de kullanılabilir. Bunu yapmak için, bazı vektör girdilerine dayalı olarak görüntü üretebilen bir üretici modeline ihtiyacımız var. Bu tür modellerden biri VQGAN (Vektör-Kuantize GAN) olarak adlandırılmaktadır.

VQGAN'ı sıradan GANdan ayıran ana fikirler şunlardır:

  • Görüntüyü oluşturan bağlam açısından zengin görsel parçaların bir dizisini üretmek için otoregresif transformer mimarisini kullanmak. Bu görsel parçalar, CNN tarafından öğrenilmektedir.
  • Görüntünün parçalarının "gerçek" mi yoksa "sahte" mi olduğunu tespit eden alt-görüntü ayrımcısı kullanmak (geleneksel GAN'daki "ya hepsi ya hiç" yaklaşımının aksine).

VQGAN hakkında daha fazla bilgi için Taming Transformers web sitesini ziyaret edin.

VQGAN ile geleneksel GAN arasındaki önemli farklardan biri, ikincisinin herhangi bir girdi vektöründen makul bir görüntü üretebilmesi iken, VQGAN'ın uyumlu bir görüntü üretme olasılığının daha düşük olmasıdır. Bu nedenle, görüntü oluşturma sürecini daha fazla yönlendirmemiz gerekmektedir ve bu, CLIP kullanılarak yapılabilir.

VQGAN+CLIP Mimarı

Bir metin istemine karşılık gelen bir görüntü üretmek için, VQGAN'dan bir görüntü üretmek üzere geçilen rastgele bir kodlama vektörü ile başlarız. Daha sonra CLIP, görüntünün metin istemine ne kadar iyi uyduğunu gösteren bir kayıp fonksiyonu üretmek için kullanılır. Amaç, bu kaybı minimize etmek ve girdi vektörü parametrelerini ayarlamak için geri yayılım kullanmaktır.

VQGAN+CLIP'i uygulayan harika bir kütüphane Pixraydir.

Pixray tarafından üretilen bir resim Pixray tarafından üretilen bir resim Pixray tarafından üretilen bir resim
Bir kedinin resmi isteminden üretilen resim Bir köpeğin resmi isteminden üretilen resim Bir insanın resmi isteminden üretilen resim

Resimler Yapay Öğretmenler koleksiyonundan Dmitry Soshnikov tarafından alınmıştır.

DALL-E

DALL-E 1

DALL-E, istemlerden görüntü üretecek şekilde eğitilmiş bir GPT-3 versiyonudur. 12 milyar parametre ile eğitilmiştir.

CLIP'ten farklı olarak, DALL-E hem metin hem de görüntüyü her iki tür için tek bir token akışı olarak alır. Bu nedenle, birden fazla istemden, metne dayalı görüntüler üretebilirsiniz.

DALL-E 2

DALL-E 1 ile 2 arasındaki ana fark, daha gerçekçi görüntüler ve sanat eserleri üretmesidir.

DALL-E ile görüntü üretim örnekleri:

Pixray tarafından üretilen bir resim Pixray tarafından üretilen bir resim Pixray tarafından üretilen bir resim
Bir kedinin resmi isteminden üretilen resim Bir köpeğin resmi isteminden üretilen resim Bir insanın resmi isteminden üretilen resim

Kaynaklar

ıklama:
Bu belge, makine tabanlı AI çeviri hizmetleri kullanılarak çevrilmiştir. Doğruluk için çaba göstersek de, otomatik çevirilerin hatalar veya yanlış anlamalar içerebileceğini lütfen dikkate alın. Orijinal belge, kendi dilinde otoriter kaynak olarak kabul edilmelidir. Kritik bilgiler için profesyonel insan çevirisi önerilmektedir. Bu çevirinin kullanımından kaynaklanan herhangi bir yanlış anlama veya yanlış yorumlama için sorumluluk kabul etmiyoruz.