Reward hacking: el término que explica por qué las IA mienten y hacen trampas para cumplir un objetivo
Hace un par de semanas, OpenAI estaba probando las capacidades de ciberseguridad de dos de sus modelos de IA. Es un proceso rutinario, lo que no es tan habitual es que los modelos consiguieran escapar del entorno de pruebas y hackear la base de datos de Hugging Face. Días después, Anthropic también reveló que tres de...