Ein solides STT Modell
Was gefällt dir am besten?
Whisper ist ein super Modell, was eben Open-Source verfügbar ist und gefinetuned werden kann. Es gehört zu den Top-Modellen in der STT-Welt und kann gut verwendet werden um verschiedene Aufgaben im ML-Bereich zu lösen, Transkription, Übersetzung etc.
Was gefällt dir nicht?
Natürlich ist es in der englischen Sprache am stärksten, es wäre super wenn auch andere Sprache annähernd so stark wären, aber das liegt leider an der Verfügbarkeit der Daten. Zudem ist Whisper ein End-to-End Modell, sprich es ist quasi eine Blackbox und man kann leider auch Teilschritte nich so einfach ausstellen. Zum Beispiel setzt das Modell automatisch Satzzeichen und macht Groß- und Kleinschreibung. Nicht in jedem Use-Case ist das sinnvoll.
Welche Probleme löst du mit dem Produkt?
Spracherkennung, Übersetzung von Texten. Das Modell wurde auf einem riesigen Datensatz trainiert, was schwer zu kopieren ist, daher ist es in mehreren Sprachen stark und aktuell eines der besten Modelle. Modelle in der Größe können nur von wenigen Unternehmen trainiert werden, daher ist es gut dass es Open-Source auch verfügbar ist.
Marius
Data Scientist bei Atruvia
Banking
5.001–10.000 Mitarbeitende