Neu zur Modellfamilie gehören MAI-Transcribe-2-Streaming, MAI-Voice-2.1 und MAI-Voice-2.1-Flash. Microsoft erweitert MAI damit um Audio-Funktionen, die für Voice-Agents gedacht sind. Die Ankündigung umfasst drei Modelle: eines mit der Bezeichnung Transcribe-2-Streaming und zwei mit Voice im Namen. Zusammen bilden sie die Audio-Erweiterung der eigenen KI-Modellfamilie von Microsoft. Weitere Angaben zu den Funktionen der einzelnen Modelle enthält der vorliegende Anriss nicht.
