Cagan Yanmaz
Index
Work
Writing
About
Writing
Notes & essays.
12 Jun 2026
A Safety Check for Deceptively Aligned Mesa-Optimisers
An incentive based safety check for superintelligent AI that may exhibit inner misalignment
ai
ai-safety
alignment
deceptive-alignment