Konuşma Tanıma Modelleri

Konuşma Tanıma için en iyi AI modellerini keşfet

1 model bulundu
Whisper Large v3 icon

Whisper Large v3

OpenAI|1.5B

Whisper Large v3, OpenAI tarafından geliştirilen ve 100'den fazla dili kapsayan 680.000 saatten fazla çeşitli ses verisi üzerinde eğitilmiş 1,55 milyar parametreli en gelişmiş çok dilli otomatik konuşma tanıma modelidir. Encoder-Decoder Transformer mimarisi üzerine inşa edilen model, ham ses dalga formlarını girdi olarak alır ve noktalama, büyük harf kullanımı ve konuşmacıya uygun biçimlendirmeyle doğru metin transkripsiyonları üretir. Whisper Large v3, İngilizce transkripsiyon için insana yakın doğruluk elde eder ve diğer ASR sistemlerinin zorlandığı düşük kaynaklı diller dahil düzinelerce dilde güçlü performans sunar. Model, hem kaynak dildeki konuşma transkripsiyonunu hem de İngilizce'ye doğrudan çeviriyi destekleyerek tek bir modelden çapraz dil içerik erişilebilirliği sağlar. V3'teki önemli iyileştirmeler arasında genişletilmiş dil kapsamı, sessiz veya gürültülü ses segmentlerinde azaltılmış halüsinasyon, aksanlı konuşmanın daha iyi işlenmesi ve altyazı üretimi için geliştirilmiş zaman damgası doğruluğu yer alır. Whisper Large v3, kayan pencere yaklaşımıyla sesi 30 saniyelik parçalar halinde işleyerek kısa sesli mesajlardan saatlerce süren ders ve podcast'lere kadar her uzunluktaki kayıtları ele alır. MIT lisansı altında tamamen açık kaynaklı olan model, açık ASR sistemleri için altın standart haline gelmiştir. Hugging Face üzerinden erişilebilir, Transformers kütüphanesiyle entegre olur ve gerçek zamanlı işleme için faster-whisper ve whisper.cpp gibi çerçevelerle hızlandırılabilir. Yaygın uygulamalar arasında toplantı transkripsiyonu, podcast ve video altyazılama, sesli metin girdisi, tıbbi dikte, işitme engelli kullanıcılar için erişilebilirlik hizmetleri ve çok dilli pazarlarda ses kontrollü uygulamalar geliştirme yer alır.

Açık Kaynak
4.8