Microsoft Research shows VASA-1, real-time talking-face generation
Trained to render 512x512 video at up to 40 frames per second from one photo and an audio clip; Microsoft said it had no plans to release a demo or model.
Models & capabilities · Security & misuse