Kendi sesinizle yapay zekâ dublajı nasıl çalışır?

Kendi sesinizle yapay zekâ dublajı, videodaki konuşmaları çevrilmiş hâliyle değiştirir; ses yine orijinal konuşmacıya ait gibi duyulur, müzik, efektler ve zamanlama ise olduğu gibi kalır.

Kısaca

  • Kendi sesinizle yapay zekâ dublajı, videodaki diyaloğu çevirir ve her orijinal konuşmacının klonlanmış sesiyle yeniden seslendirir; izleyici aynı kişiyi yeni bir dilde duyar.
  • Süreç ayrı aşamalardan oluşur: diyaloğu müzik ve efektlerden ayırmak, kimin ne zaman konuştuğunu bulmak, metne dökmek, zamanlamaya uyacak şekilde çevirmek, klonlanmış sesle konuşma üretmek ve yeniden miks etmek.
  • Duygu ve tempo aktarımı yalnızca desteklenen dillerde çalışır; dudak senkronu ise geniş çekimlere değil, yüzü kameraya dönük yakın çekimlere uygun, isteğe bağlı bir adımdır.
  • Sonucu kullanılabilir kılan şey satır satır kalite kontroldür: her satırın zamanlaması, doğruluğu ve ses benzerliği kontrol edilir, zayıf satırlar tek tek düzeltilip yeniden üretilir.
  • Bir konuşmacının sesi yalnızca onun izniyle klonlanmalıdır.

Kendi sesinizle yapay zekâ dublajı nedir?

Geleneksel dublajda her dil için yeni bir seslendirme sanatçısı tutulur. Kendi sesinizle yapay zekâ dublajı farklı bir yol izler. Konuşmacının orijinal kaydından bir ses modeli oluşturur ve çevrilmiş satırları bu sesle söyletir.

Ortaya videonuzun başka bir dildeki sürümü çıkar ve orada da sizin sesiniz duyulur. Kanalınızı ya da sunucularınızı tanıyan izleyiciler, kelimeler yeni olsa da sesi tanır.

Bu işi tek bir model tek seferde yapmaz. İyi sonuç, her biri ayrı ayrı kontrol edilip düzeltilebilen bir dizi adımdan gelir.

Adım adım nasıl çalışır?

Diyaloğu müzik ve efektlerden ayırmak

İlk iş, sesleri miksin içinden çekip almaktır. Bir kaynak ayrıştırma modeli orijinal sesi ikiye böler: bir diyalog kanalı ve müzik, ortam sesi ve efektleri içeren bir arka plan kanalı.

Bunun önemi şu: değişmesi gereken yalnızca diyalogdur. Arka plan kanalı saklanır ve sonra yeni seslerle birleştirilir, böylece video orijinal ses tasarımını korur.

Kimin ne zaman konuştuğunu bulmak

Ardından konuşmacı ayrıştırma gelir: her an kimin konuştuğunu belirlemek. Bir röportajda ya da çok kişili bir videoda her satırın doğru kişiye atanması gerekir ki doğru sesle yeniden seslendirilebilsin.

Üst üste binen konuşmalar, kısa araya girmeler ve birbirine benzeyen sesler burada en zor durumlardır. Bu aşamadaki hatalar sürecin geri kalanına taşınır, bu yüzden erken kontrol etmek işe yarar.

Konuşmayı metne dökmek

Diyalog daha sonra her satır için zaman damgalarıyla birlikte metne dönüştürülür. Özel isimler, ürün adları ve teknik terimler sık sorun çıkarır; bir terim listesi ya da metnin kısa bir insan kontrolünden geçmesi zahmetine değer.

Zamanlamaya uyan çeviri

Birebir çeviri çoğu zaman orijinal satır için ya çok uzun ya da çok kısa kalır. Bazı diller aynı şeyi söylemek için doğal olarak daha fazla kelimeye ihtiyaç duyar.

Bu yüzden dublaj çevirisi, mevcut süreye sığan bir anlamı hedefler. Çeviriyi yapan insan da olsa makine de olsa, yeni satırın orijinal süre içinde doğal bir hızla söylenebilmesi için ifadeyi kısaltabilir, daha kısa bir kelime seçebilir ya da cümleyi yeniden kurabilir.

Sesi klonlamak ve konuşmayı üretmek

Her konuşmacının sesi, temizlenmiş diyalog kanalından modellenir. Çevrilmiş satırlar sonra hedef dilde, bu klonlanmış sesle üretilir.

Temiz ve makul uzunlukta bir kaynak ses en iyi benzerliği verir. Yoğun arka plan gürültüsü, belirgin yankı ya da konuşmacının çok kısa görünmesi klonun isabetini düşürür.

Duygu ve tempoyu aktarmak

Heyecanla söylenmiş bir satır düz bir tonla çıkmamalı. Desteklenen dillerde sistem, orijinal söyleyişteki duyguyu, vurguyu ve tempoyu yeni satıra taşıyabilir.

Bu özellik her dilde yok. Desteklenmeyen dillerde ses yine konuşmacıya benzer, ancak anlatım daha nötr kalabilir.

Yeni diyaloğu miks etmek

Üretilen satırlar zaman çizelgesine yerleştirilir ve saklanan arka plan kanalıyla miks edilir. Seviyeler, ortam tonu ve geçişler dengelenir; böylece yeni ses sahnenin içinde durur, sonradan yapıştırılmış gibi duyulmaz.

İsteğe bağlı dudak senkronu

Dudak senkronu, konuşmacının ağız hareketlerini yeni dile uyacak şekilde düzenler. En çok yüzün kameraya dönük olduğu ve ağzın net göründüğü yakın çekimlerde işe yarar.

Geniş çekimlerde, yandan açılarda ya da konuşmacının kadrajda küçük kaldığı sahnelerde dudak senkronu uygulanmaz. İzleyici orada ağız uyumsuzluğunu nadiren fark eder; zorlamak ise görüntüde bozulmalara yol açabilir.

Satır satır kalite kontrol

Son adım gözden geçirmedir. Her satırın zamanlaması, çeviri doğruluğu ve sesin orijinal konuşmacıya ne kadar benzediği ölçülür. Yetersiz kalan satırlar işaretlenir.

Ardından bir kişi tek bir satırın metnini düzenleyebilir, örneğin bir terimi düzeltebilir ya da ifadeyi kısaltabilir, ve yalnızca o satırı yeniden üretebilir. Tek bir hata için bütün videoyu baştan yapmak gerekmez.

Neler iyi çalışır?

Sınırları neler?

Sınırları net bilmek, dublaj için doğru videoları seçmenize yardım eder.

Bunların hiçbiri kontrol ihtiyacını ortadan kaldırmaz. Çıktıyı, yayına girmeden önce satır satır gözden geçirilen güçlü bir taslak olarak görün.

Ses kişiseldir. Konuklar, ortak sunucular ya da röportaj yaptığınız kişiler dahil, kimsenin sesini izni olmadan klonlamayın. Sorumlu bir dublaj süreci, onay vermemiş bir konuşmacının sesini klonlamayı reddetmelidir.

İşlem sırasında sesin nereye gittiğini ve model eğitiminde kullanılıp kullanılmadığını sormak da önemlidir. Bu sorular sizin kadar konuklarınız için de önem taşır.

Dublayer buna nasıl yaklaşıyor?

Dublayer yukarıdaki adımları izler. Her konuşmacı kendi sesiyle dublajlanır, müzik ve efektler korunur, yalnızca diyalog değişir. Her satırın zamanlaması, doğruluğu ve ses benzerliği ölçülür, sorunlu satırlar işaretlenir ve tek bir satır düzenlenip yeniden üretilebilir. Duygu aktarımı desteklenen dillerde çalışır, dudak senkronu ise yakın ve yüzü kameraya dönük çekimler için isteğe bağlıdır.

Her müşteriye özel bir GPU sunucusu ayrılır. Ses bu sunucudan çıkmaz, dış yapay zekâ servisi ya da telemetri kullanılmaz, yüklenen içerikler model eğitiminde kullanılmaz ve izni olmayan konuşmacının sesi klonlanmaz. Testlerimizde 45 dakikalık bir video tek dile yaklaşık 3 saatte dublajlandı; sonraki her dil daha kısa sürer, tahminimiz dudak senkronu kapalıyken 1,5 ila 2 saat. Kendi videolarınızı konuşmak için teklif isteyin, sizinle bir görüşme ayarlayalım.

Sık sorulan sorular

Kendi sesinizle yapay zekâ dublajı için yeni dilde kayıt yapmanız gerekir mi?

Hayır. Sistem konuşmacının sesini orijinal kayıttan öğrenir ve yeni dildeki diyaloğu bu sesle üretir. Konuşmacının hedef dili bilmesi ya da yeniden kayıt yapması gerekmez, ancak sesinin klonlanmasına izin vermesi gerekir.

Yapay zekâ dublajında dudak senkronu her zaman uygulanır mı?

Hayır. Dudak senkronu genellikle isteğe bağlıdır ve konuşmacının yüzünün kameraya dönük olduğu yakın çekimlerde en iyi sonucu verir. Geniş çekimlerde, profil çekimlerde ya da ağzın net görünmediği sahnelerde normalde uygulanmaz, çünkü orijinal görüntü zaten yeterince doğal durur.

Yapay zekâ dublajı duyguyu ve tonu her dile aktarır mı?

Her dile değil. Duygu ve tempo aktarımı modele ve dil çiftine bağlıdır, bu yüzden yalnızca desteklenen dillerde kullanılabilir. Diğer dillerde ses yine konuşmacıya benzer, ancak anlatım daha düz kalabilir.