Yapay Zekâ

Qwen 3.8 LiveTranslate, çok konuşmacılı çeviride görüntü bağlamını da kullanıyor

Gerçek zamanlı hizmet, ses ve görüntü girdisini birleştirerek konuşmacıları ayırmayı ve çevrilen metni üretmeyi amaçlıyor.

Mizan Haber Teknoloji Servisi· 2 dk okuma

Duyuru / olay tarihi:

İki konuşmacının sesini ayrı renkli çeviri dalgalarıyla birleştiren toplantı cihazının kavramsal AI görseli.
Mizan Haber · Yapay zekâyla üretilmiş temsilî görsel. Gerçek olay veya ürün fotoğrafı değildir.

Qwen, 18 Eylül 2026'da Qwen 3.8 LiveTranslate'ı tanıttı. Güncel hizmet belgeleri, ses ve görüntü girdisinden gerçek zamanlı çeviri üretildiğini ve farklı konuşmacıların ayrılabildiğini açıklıyor. Bu haber bir API hizmetini konu alıyor; model ağırlıklarının açık biçimde indirilebildiğine dair ayrı bir duyuru yerine geçmiyor.

Belgelerde toplam 60 dilin desteklendiği, bunların 29'unda hem ses hem metin çıktısı, 31'inde ise yalnızca metin çıktısı bulunduğu belirtiliyor. Dolayısıyla bütün desteklenen dillerde aynı tür sesli deneyim sunulduğu varsayılmamalı. Bir uygulama tasarlanırken giriş dili ile istenen çıktı türünün ayrı kontrol edilmesi gerekiyor.

QwenCloud rehberi, görüntünün dudak hareketleri, jestler veya ekrandaki yazılar gibi bağlamlarla çeviriye yardımcı olabileceğini söylüyor. Alibaba Cloud'un model sayfası da ses ve görüntü girdisini, metin ve ses çıktısını doğruluyor. Bu bilgiler, görüntü bağlamının her belirsizliği çözdüğüne veya gürültülü her ortamda hatasız çeviri sağlandığına dair garanti değil.

Konuşmacı ve anlamın korunması

İstemci olayları belgesi, WebSocket bağlantısı üzerinden oturum kurulmasını ve yapılandırmanın sunucu tarafından doğrulanmasını açıklıyor. Böylece geliştiricinin yalnızca ses göndermek yerine oturumun hedef dilini ve çıktı seçeneklerini açıkça belirlemesi gerekiyor. Bağlantının kurulması ile geçerli bir çeviri akışının başlaması farklı adımlar olarak ele alınıyor.

Editoryal değerlendirmemize göre çok konuşmacılı kullanımda asıl değer, kimin ne söylediğinin korunması. Akıcı bir çeviri, yanlış kişiye bağlandığında anlamını değiştirebilir. Bu nedenle uygulamalar yalnızca çevrilen cümlenin doğruluğunu değil, konuşmacı ayrımını ve cümlelerin sırasını da kendi görüşme örnekleri üzerinde incelemeli.

Görüntü kullanımı da pratik koşullara bağlı. Konuşmacının kamerada görünmediği, aynı anda birden çok kişinin konuştuğu veya bağlantının zayıfladığı durumlar farklı sonuçlar yaratabilir. Bizce ürün denemeleri yalnızca sakin stüdyo kayıtlarıyla sınırlı kalmamalı; gerçek görüşmelerin kesintileri ve belirsizlikleri de değerlendirme kümesine dahil edilmeli.

Gerçek zamanlı çeviride bekleme süresi ile anlamı tamamlamak arasında denge var. Sistem bir cümleyi çok erken çevirirse sonradan gelen sözcükler anlamı değiştirebilir; fazla beklerse konuşmanın akışı zorlaşır. Genel bir gecikme sayısı, bütün ağ koşullarını ve cümle yapılarını temsil etmez. Kullanıcı deneyimi, bu dengeyle birlikte ölçülmeli.

Qwen 3.8 LiveTranslate, sesli AI hizmetlerinde çevirinin görüntü ve konuşmacı bilgisiyle birlikte ele alındığını gösteriyor. Haberin somut tarafı, belgelenmiş dil ve çıktı kapsamı ile oturum tabanlı API. Başarıyı belirleyecek sonuç ise gerçek konuşmalarda anlamın, konuşmacı kimliğinin ve sıralamanın ne kadar tutarlı korunabildiği olacak.

■ MİZAN HABER