UniAudio 2.0 v2.0
UniAudio 2.0 is a unified audio language model designed to handle text, speech, sound, and music. It introduces ReasoningCodec, a discrete audio codec that factorizes audio into reasoning and reconstruction tokens, enhancing both understanding and generation tasks. The model is trained on 100 billion text tokens and 60 billion audio tokens, demonstrating strong performance across various audio tasks.
ReasoningCodec for audio factorization
Unified autoregressive architecture for text and audio
Trained on extensive text and audio datasets