Kendi sesinizle yapay zekâ dublajı nasıl çalışır?
Kendi sesinizle yapay zekâ dublajı, videodaki konuşmaları çevrilmiş hâliyle değiştirir; ses yine orijinal konuşmacıya ait gibi duyulur, müzik, efektler ve zamanlama ise olduğu gibi kalır.
Kısaca
- Kendi sesinizle yapay zekâ dublajı, videodaki diyaloğu çevirir ve her orijinal konuşmacının klonlanmış sesiyle yeniden seslendirir; izleyici aynı kişiyi yeni bir dilde duyar.
- Süreç ayrı aşamalardan oluşur: diyaloğu müzik ve efektlerden ayırmak, kimin ne zaman konuştuğunu bulmak, metne dökmek, zamanlamaya uyacak şekilde çevirmek, klonlanmış sesle konuşma üretmek ve yeniden miks etmek.
- Duygu ve tempo aktarımı yalnızca desteklenen dillerde çalışır; dudak senkronu ise geniş çekimlere değil, yüzü kameraya dönük yakın çekimlere uygun, isteğe bağlı bir adımdır.
- Sonucu kullanılabilir kılan şey satır satır kalite kontroldür: her satırın zamanlaması, doğruluğu ve ses benzerliği kontrol edilir, zayıf satırlar tek tek düzeltilip yeniden üretilir.
- Bir konuşmacının sesi yalnızca onun izniyle klonlanmalıdır.
Kendi sesinizle yapay zekâ dublajı nedir?
Geleneksel dublajda her dil için yeni bir seslendirme sanatçısı tutulur. Kendi sesinizle yapay zekâ dublajı farklı bir yol izler. Konuşmacının orijinal kaydından bir ses modeli oluşturur ve çevrilmiş satırları bu sesle söyletir.
Ortaya videonuzun başka bir dildeki sürümü çıkar ve orada da sizin sesiniz duyulur. Kanalınızı ya da sunucularınızı tanıyan izleyiciler, kelimeler yeni olsa da sesi tanır.
Bu işi tek bir model tek seferde yapmaz. İyi sonuç, her biri ayrı ayrı kontrol edilip düzeltilebilen bir dizi adımdan gelir.
Adım adım nasıl çalışır?
Diyaloğu müzik ve efektlerden ayırmak
İlk iş, sesleri miksin içinden çekip almaktır. Bir kaynak ayrıştırma modeli orijinal sesi ikiye böler: bir diyalog kanalı ve müzik, ortam sesi ve efektleri içeren bir arka plan kanalı.
Bunun önemi şu: değişmesi gereken yalnızca diyalogdur. Arka plan kanalı saklanır ve sonra yeni seslerle birleştirilir, böylece video orijinal ses tasarımını korur.
Kimin ne zaman konuştuğunu bulmak
Ardından konuşmacı ayrıştırma gelir: her an kimin konuştuğunu belirlemek. Bir röportajda ya da çok kişili bir videoda her satırın doğru kişiye atanması gerekir ki doğru sesle yeniden seslendirilebilsin.
Üst üste binen konuşmalar, kısa araya girmeler ve birbirine benzeyen sesler burada en zor durumlardır. Bu aşamadaki hatalar sürecin geri kalanına taşınır, bu yüzden erken kontrol etmek işe yarar.
Konuşmayı metne dökmek
Diyalog daha sonra her satır için zaman damgalarıyla birlikte metne dönüştürülür. Özel isimler, ürün adları ve teknik terimler sık sorun çıkarır; bir terim listesi ya da metnin kısa bir insan kontrolünden geçmesi zahmetine değer.
Zamanlamaya uyan çeviri
Birebir çeviri çoğu zaman orijinal satır için ya çok uzun ya da çok kısa kalır. Bazı diller aynı şeyi söylemek için doğal olarak daha fazla kelimeye ihtiyaç duyar.
Bu yüzden dublaj çevirisi, mevcut süreye sığan bir anlamı hedefler. Çeviriyi yapan insan da olsa makine de olsa, yeni satırın orijinal süre içinde doğal bir hızla söylenebilmesi için ifadeyi kısaltabilir, daha kısa bir kelime seçebilir ya da cümleyi yeniden kurabilir.
Sesi klonlamak ve konuşmayı üretmek
Her konuşmacının sesi, temizlenmiş diyalog kanalından modellenir. Çevrilmiş satırlar sonra hedef dilde, bu klonlanmış sesle üretilir.
Temiz ve makul uzunlukta bir kaynak ses en iyi benzerliği verir. Yoğun arka plan gürültüsü, belirgin yankı ya da konuşmacının çok kısa görünmesi klonun isabetini düşürür.
Duygu ve tempoyu aktarmak
Heyecanla söylenmiş bir satır düz bir tonla çıkmamalı. Desteklenen dillerde sistem, orijinal söyleyişteki duyguyu, vurguyu ve tempoyu yeni satıra taşıyabilir.
Bu özellik her dilde yok. Desteklenmeyen dillerde ses yine konuşmacıya benzer, ancak anlatım daha nötr kalabilir.
Yeni diyaloğu miks etmek
Üretilen satırlar zaman çizelgesine yerleştirilir ve saklanan arka plan kanalıyla miks edilir. Seviyeler, ortam tonu ve geçişler dengelenir; böylece yeni ses sahnenin içinde durur, sonradan yapıştırılmış gibi duyulmaz.
İsteğe bağlı dudak senkronu
Dudak senkronu, konuşmacının ağız hareketlerini yeni dile uyacak şekilde düzenler. En çok yüzün kameraya dönük olduğu ve ağzın net göründüğü yakın çekimlerde işe yarar.
Geniş çekimlerde, yandan açılarda ya da konuşmacının kadrajda küçük kaldığı sahnelerde dudak senkronu uygulanmaz. İzleyici orada ağız uyumsuzluğunu nadiren fark eder; zorlamak ise görüntüde bozulmalara yol açabilir.
Satır satır kalite kontrol
Son adım gözden geçirmedir. Her satırın zamanlaması, çeviri doğruluğu ve sesin orijinal konuşmacıya ne kadar benzediği ölçülür. Yetersiz kalan satırlar işaretlenir.
Ardından bir kişi tek bir satırın metnini düzenleyebilir, örneğin bir terimi düzeltebilir ya da ifadeyi kısaltabilir, ve yalnızca o satırı yeniden üretebilir. Tek bir hata için bütün videoyu baştan yapmak gerekmez.
Neler iyi çalışır?
- Kameraya konuşan ve sunuculu içerikler. Net konuşma, bir ya da birkaç konuşmacı ve dengeli tempo en temiz sonucu verir.
- Müzik ve efekt içeren videolar. Arka plan ayrılıp korunduğu için dublajlı sürüm orijinal atmosferi kaybetmez.
- Düzenli olarak yer alan konuşmacılar. Birçok videoda aynı sunucuların yer aldığı kanallar, her dilde tutarlı ve tanınan seslerden yararlanır.
- Yakın çekim röportajlar. İsteğe bağlı dudak senkronu en çok kameraya dönük çekimlerde fark yaratır.
Sınırları neler?
Sınırları net bilmek, dublaj için doğru videoları seçmenize yardım eder.
- Dudak senkronu çekime bağlıdır. Yüzü kameraya dönük yakın çekimlerde uygulanır, geniş ya da yandan çekimlerde uygulanmaz.
- Duygu aktarımı dile bağlıdır. Yalnızca desteklenen dillerde çalışır.
- Üst üste konuşma zordur. Birkaç kişi aynı anda konuştuğunda ayrıştırma ve konuşmacı tespiti daha az güvenilir olur.
- Kötü kaynak ses klonu sınırlar. Gürültü, yankı ve patlayan ses, ses benzerliğini düşürür.
- Mizah, kelime oyunları ve kültürel göndermeler yalnızca çevrilmekle kalmayıp bir insan tarafından uyarlanmayı gerektirebilir.
Bunların hiçbiri kontrol ihtiyacını ortadan kaldırmaz. Çıktıyı, yayına girmeden önce satır satır gözden geçirilen güçlü bir taslak olarak görün.
Peki ya izin?
Ses kişiseldir. Konuklar, ortak sunucular ya da röportaj yaptığınız kişiler dahil, kimsenin sesini izni olmadan klonlamayın. Sorumlu bir dublaj süreci, onay vermemiş bir konuşmacının sesini klonlamayı reddetmelidir.
İşlem sırasında sesin nereye gittiğini ve model eğitiminde kullanılıp kullanılmadığını sormak da önemlidir. Bu sorular sizin kadar konuklarınız için de önem taşır.
Dublayer buna nasıl yaklaşıyor?
Dublayer yukarıdaki adımları izler. Her konuşmacı kendi sesiyle dublajlanır, müzik ve efektler korunur, yalnızca diyalog değişir. Her satırın zamanlaması, doğruluğu ve ses benzerliği ölçülür, sorunlu satırlar işaretlenir ve tek bir satır düzenlenip yeniden üretilebilir. Duygu aktarımı desteklenen dillerde çalışır, dudak senkronu ise yakın ve yüzü kameraya dönük çekimler için isteğe bağlıdır.
Her müşteriye özel bir GPU sunucusu ayrılır. Ses bu sunucudan çıkmaz, dış yapay zekâ servisi ya da telemetri kullanılmaz, yüklenen içerikler model eğitiminde kullanılmaz ve izni olmayan konuşmacının sesi klonlanmaz. Testlerimizde 45 dakikalık bir video tek dile yaklaşık 3 saatte dublajlandı; sonraki her dil daha kısa sürer, tahminimiz dudak senkronu kapalıyken 1,5 ila 2 saat. Kendi videolarınızı konuşmak için teklif isteyin, sizinle bir görüşme ayarlayalım.
Sık sorulan sorular
Kendi sesinizle yapay zekâ dublajı için yeni dilde kayıt yapmanız gerekir mi?
Hayır. Sistem konuşmacının sesini orijinal kayıttan öğrenir ve yeni dildeki diyaloğu bu sesle üretir. Konuşmacının hedef dili bilmesi ya da yeniden kayıt yapması gerekmez, ancak sesinin klonlanmasına izin vermesi gerekir.
Yapay zekâ dublajında dudak senkronu her zaman uygulanır mı?
Hayır. Dudak senkronu genellikle isteğe bağlıdır ve konuşmacının yüzünün kameraya dönük olduğu yakın çekimlerde en iyi sonucu verir. Geniş çekimlerde, profil çekimlerde ya da ağzın net görünmediği sahnelerde normalde uygulanmaz, çünkü orijinal görüntü zaten yeterince doğal durur.
Yapay zekâ dublajı duyguyu ve tonu her dile aktarır mı?
Her dile değil. Duygu ve tempo aktarımı modele ve dil çiftine bağlıdır, bu yüzden yalnızca desteklenen dillerde kullanılabilir. Diğer dillerde ses yine konuşmacıya benzer, ancak anlatım daha düz kalabilir.