Dario Amodei propone ralentizar el avance de los modelos más potentes para que sus controles de seguridad puedan seguir el ritmo, una dirección respaldada públicamente por Sam Altman, Elon Musk y Demis Hassabis.
Dario Amodei, director ejecutivo de Anthropic, ha propuesto reducir el ritmo con el que aumentan las capacidades de los modelos de inteligencia artificial más avanzados. Su planteamiento no consiste en detener el entrenamiento ni paralizar el progreso, sino en reservar tiempo suficiente para evaluar cada salto de capacidad, mejorar las salvaguardas y corregir posibles fallos antes de avanzar al siguiente nivel.
La propuesta parte de dos preocupaciones. La primera es que los sistemas de IA participan cada vez más en la creación de sus sucesores, lo que puede acelerar el desarrollo y dificultar que las técnicas de control progresen a la misma velocidad. La segunda son los comportamientos inesperados observados en grupos de agentes durante pruebas recientes, especialmente cuando varios sistemas trabajan de forma coordinada y persiguen un objetivo con poca supervisión.
Amodei advierte de que, si las capacidades continúan creciendo sin controles equivalentes, en un plazo de entre seis y doce meses podrían aparecer grupos de agentes capaces de provocar ataques informáticos a gran escala. Se trata de una previsión planteada por el propio directivo, no de una capacidad demostrada actualmente, pero es el riesgo que utiliza para defender una respuesta más rápida por parte de los laboratorios.
El primer paso concreto será incorporar evaluadores externos dentro de Anthropic. Estos equipos dispondrán de puestos de trabajo, equipos de la empresa y acceso continuado a herramientas e información comparable al de los empleados que analizan riesgos, con excepciones para proteger datos privados, obligaciones legales y secretos de terceros.
Los evaluadores podrán revisar procesos de entrenamiento, comprobar si se cumplen los compromisos de seguridad, informar de incidentes y publicar conclusiones sin control editorial de Anthropic. La empresa podrá ocultar datos legalmente protegidos o especialmente sensibles, pero los revisores tendrán la posibilidad de indicar públicamente si una supresión afecta a sus conclusiones.
El plan añade dos niveles más difíciles: coordinar estándares y límites comunes entre los principales laboratorios de países democráticos, y buscar después acuerdos internacionales que puedan comprobarse. Amodei plantea que estos límites se relacionen con capacidades observables y con pruebas de seguridad, en lugar de aplicar una pausa general e indefinida.
La idea recibió respaldo público de Sam Altman, director ejecutivo de OpenAI; Elon Musk, responsable de xAI; y Demis Hassabis, cofundador de Google DeepMind. Los tres coincidieron en la necesidad de acompasar el avance de los modelos, aunque sus mensajes no fijan todavía reglas compartidas, plazos ni un compromiso conjunto entre las compañías.
Por ahora, el cambio verificable es el compromiso unilateral de Anthropic con los evaluadores externos. La coordinación entre competidores y países continúa sin resolver, por lo que el apoyo de los cuatro líderes marca una dirección común poco habitual, pero aún no equivale a una reducción efectiva y coordinada del ritmo de desarrollo de la IA.