Un científico de Anthropic advierte que una futura superinteligencia podría acabar con la humanidad

Un científico de Anthropic advierte que una futura superinteligencia podría acabar con la humanidad

La posibilidad de que una inteligencia artificial llegue a exterminar a la humanidad fue planteada públicamente por Evan Hubinger, líder de ciencia de alineación de Anthropic, la empresa responsable del desarrollo de Claude. Según el científico, este riesgo podría materializarse durante la próxima década.

Hubinger expresó su posición en una publicación en X, en la que respaldó las advertencias de Jacob Coxon. «Jacob (Coxon) tiene razón en esto: realmente creemos, y lo creemos sinceramente, que la IA podría matar a todos los seres humanos», escribió. De acuerdo con la información de su perfil, sus declaraciones fueron realizadas a título personal.

La intervención se conoció después de la renuncia de Coxon, un ingeniero de Anthropic que cuestionó la conducta de las grandes compañías de inteligencia artificial. El exintegrante sostuvo que esas empresas «no están actuando con responsabilidad» y que «están jugando con nuestras vidas». También afirmó que quienes impulsan la IA creen que esta tecnología podría matar a toda la humanidad antes del final de esta década, algo que calificó como una amenaza sin precedentes.

Creo que Anthropic está haciendo todo lo posible, pero todavía no tenemos un plan para resolver el problema de la alineación en el caso de una superinteligencia, y tampoco estamos claramente encaminados a lograrlo.

El desafío de controlar una superinteligencia

El área de trabajo de Hubinger, conocida como alineación, busca garantizar que los sistemas de IA más avanzados se comporten de manera segura y acorde con los objetivos humanos. El desafío adquiere mayor importancia a medida que se desarrollan modelos capaces de reescribir su propio código.

La preocupación se produce en un contexto de avances acelerados en el sector. OpenAI también abordó recientemente los riesgos asociados con estas tecnologías al presentar GPT-6 Astra. La compañía señaló entonces la necesidad de contar con «salvaguardas más sólidas», luego de que el modelo alcanzara el «umbral de capacidad crítica de ciberseguridad», considerado el nivel de mayor riesgo.

Hubinger aclaró que, a su juicio, el peligro asociado con los modelos actuales es bajo. Su principal preocupación está puesta en una superinteligencia surgida de un proceso de auto-mejora recursiva, que, según afirmó, se está desarrollando más rápido de lo previsto.

Las advertencias del propio informe de Anthropic

El último informe de riesgos de Anthropic plantea que los modelos avanzados pueden ofrecer beneficios, pero también generar consecuencias graves, entre ellas alterar el equilibrio de poder dentro de los países y entre ellos.

El documento agrega que, si esas capacidades se combinaran con objetivos autónomos peligrosos, los propios sistemas de IA podrían iniciar daños catastróficos.

Aunque Anthropic evalúa estos escenarios y desarrolla salvaguardas para prevenir formas peligrosas de desalineación, la empresa reconoce que todavía no ha conseguido avances significativos hacia cada uno de esos objetivos.

Deja una respuesta