Model
1 entry · 30 April 2020
Compressed raw audio into discrete codes with a multi-scale VQ-VAE, then modelled those with autoregressive transformers to keep coherence over several minutes.
Models & capabilities