Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

x.microsoft.247wallst.Microsoft hat am Donnerstag drei hauseigene Modelle für künstliche Intelligenz zur Transkription und Spracherzeugung veröffentlicht. Das Unternehmen entwickelt zunehmend eigene KI-Technologien, um Entwickler von konversationsbasierten Sprachagenten für sich zu gewinnen.
Microsoft AI kündigte MAI-Transcribe-2-Streaming, MAI-Voice-2.1 und MAI-Voice-2.1-Flash auf X an und erklärte, dass alle drei "ab heute verfügbar" seien. Das Unternehmen beschrieb die Veröffentlichung als "präzise Streaming-Transkription" mit "natürlicher Sprache und weniger Wartezeit zwischen den Redebeiträgen."x
MAI-Transcribe-2-Streaming ist laut einem Blogbeitrag von Microsoft AI das erste Streaming-Transkriptionsmodell des Unternehmens. Es wandelt Sprache in Text um, während die Person spricht, anstatt das Ende der Aufnahme abzuwarten. Microsoft gibt an, dass das Modell 60 Sprachen unterstützt und automatisch erkennt, welche Sprache gesprochen wird, selbst wenn diese während eines Gesprächs wechselt. Der Einführungspreis des Modells liegt bei 0,54 US-Dollar pro Audiostunde.seekingalpha+1
Das Modell belegte den ersten Platz im AA-WER Streaming-Benchmark von Artificial Analysis, der die Wortfehlerrate misst. Laut 24/7 Wall St., die sich auf das Analyseunternehmen berufen, erreichte es sowohl bei der Genauigkeit der vollständigen Transkription als auch bei der Genauigkeit der ersten Teiltranskription den Spitzenplatz mit einer Wortfehlerrate von 2,5 Prozent. Microsoft gibt zudem an, dass das Modell bei Artificial Analysis auf Platz eins debütierte.microsoft+1
Das neue Modell ergänzt MAI-Transcribe-2, das in der Microsoft-Dokumentation als "Sprache-zu-Text-Modell der nächsten Generation, das intern vom Microsoft AI-Team entwickelt wurde" bezeichnet wird. Entwickler konnten dieses Modell bereits über den Sprachdienst von Azure nutzen.learn.microsoft
Microsoft gibt an, dass MAI-Voice-2.1 "ausdrucksstarke Sprache mit geringer Latenz" erzeugt, die auch bei langen Passagen stabil bleibt. In der Modellliste von OpenRouter wird MAI-Voice-2.1 als das Text-zu-Sprache-Modell mit der höchsten Wiedergabetreue von Microsoft AI beschrieben und soll in 23 Sprachen funktionieren. MAI-Voice-2.1-Flash ist eine leichtere Version, die auf Geschwindigkeit optimiert wurde. Beide Sprachmodelle sowie der Streaming-Transkriber sind über das AI Gateway von Vercel zu den von Microsoft genannten Preisen verfügbar.daily+3
Die Veröffentlichung ist die neueste Ergänzung der MAI-Modellfamilie von Microsoft AI, derselben Gruppe, die auch für die früheren MAI-Voice- und MAI-1-Modelle verantwortlich ist. In einer Marktanalyse argumentierte 24/7 Wall St., dass jede Ebene des KI-Stacks, die Microsoft selbst entwickelt, eine ist, bei der das Unternehmen "nicht mehr von einem externen Zulieferer abhängig ist." Das Portal merkte an, dass das Benchmark-Ergebnis darauf hindeutet, dass die internen Fähigkeiten von Microsoft "schneller reifen, als es die öffentliche Wahrnehmung bisher widerspiegelte."eesel+1