← Back to the wire

Meta's new real-time audio model is the foundation for AI assistants that never stop listening

AnnouncementModelSep 6, 2026

Independent evaluation by Artificial Analysis confirms Meta's claims: Muse Voice Transcribe achieves a 3.1 percent word error rate on English in 0.16 seconds. The Spark-family model, Meta Superintelligence Labs' first real-time audio perception model, distinguishes over 20 speakers and supports more than 70 languages. At $0.18 per hour, it undercuts OpenAI and ElevenLabs pricing. It is available now in Meta AI and via the Meta Model API; Meta has not disclosed parameter counts or released weights.

Receipt № 17681 source · awaiting confirmation ◐

Evidence

1source· awaiting independent confirmation

No score is assigned. Sources and their independence are shown in the citation chain below.

Citation chain · 1 source

OpenAICompanyMetaCompanyElevenLabsCompanySuperintelligence LabsCompanyMuse Voice TranscribeModelSpark-family modelModel
Canonical: https://the-decoder.com/metas-new-real-time-audio-model-is-the-foundation-for-ai-assistants-that-never-stop-listening/