x
Takes One to Know One - Training a model to grade reward hacks causes it to reward hack less itself — LessWrong