DeepMind and collaborators publish framework for evaluating extreme AI risks
Twenty-one researchers across nine labs and universities proposed testing models for capabilities such as deception and cyber-offence before training runs finish, not after release.
Safety & alignment