Kurumsal yapay zeka şirketi Cohere Perşembe günü ilk ses modelini piyasaya sürdü: Transcribe, not alma ve konuşma analizi gibi görevler için kullanılabilen açık kaynaklı bir otomatik konuşma tanıma modelidir.
Sadece 2 milyar parametre ile nispeten hafif olan model, kendi kendine barındırmak isteyenler için tüketici sınıfı GPU'larla kullanılmak üzere tasarlanmıştır. Şu anda 14 dili desteklemektedir: İngilizce, Fransızca, Almanca, İtalyanca, İspanyolca, Portekizce, Yunanca, Hollandaca, Lehçe, Çince, Japonca, Korece, Vietnamca ve Arapça.
Cohere, Transcribe'ın Hugging Face Open ASR liderlik tablosunda Zoom Scribe v1, IBM Granite 4.0 1B, ElevenLabs Scribe v2 ve Qwen3-ASR-1.7B Speech gibi modelleri geride bıraktığını ve ortalama 5,42 kelime hata oranı (WER) elde ederek kıyaslamadaki diğer tüm modellerden daha düşük olduğunu söylüyor.
Şirket, insan değerlendiricilerin transkripsiyonlarını doğruluk, tutarlılık ve kullanılabilirlik açısından değerlendirdiğinde Transcribe'ın diğer modellere göre ortalama %61'lik bir kazanma oranına sahip olduğunu iddia ediyor. Ancak model Portekizce, Almanca ve İspanyolca transkripsiyon yapmak zorunda kaldığında rakiplerinin gerisinde kaldı.
Cohere, Transcribe'ın dakikada 525 dakikalık ses işleyebildiğini ve bunun kendi sınıfındaki modeller için yüksek bir rakam olduğunu söylüyor.
Şirket, Transcribe'ı kurumsal aracı düzenleme platformu North'a entegre etmeyi planlıyor ve modeli API'si aracılığıyla ücretsiz olarak kullanıma sunuyor. Model ayrıca Cohere'in yönetilen çıkarım platformu Model Valut'ta da mevcut olacak.
Granola ve Wispr Flow gibi not alma ve dikte uygulamalarına olan talep arttıkça konuşma tanıma modelleri de giderek daha popüler hale geliyor.
Bu yılın başlarında Cohere'in yatırımcılara 2025 yılında yıllık 240 milyon dolar yinelenen gelir elde edeceğini söylediği ve CEO'su Aidan Gomez'in girişimin "yakında" halka açılabileceğini söylediği bildirildi.


