--:--:--btc
← lateralbuilder.com

blog.

la actualidad de la inteligencia artificial, contada para que la entienda cualquiera.

Foto del autor
@lateralbuilder
Versión explicada para cualquiera

El modelo de IA que acepta hacer ciberataques: la carrera armamentística entre OpenAI y China

Un modelo de inteligencia artificial de código abierto chino ha alcanzado el nivel técnico de los mejores del mundo, pero no rechaza tareas peligrosas como ataques informáticos o experimentos biológicos letales. El problema: una vez que descargas el código, nadie puede impedirte usarlo como quieras.

Qué acaba de pasar

Un laboratorio de inteligencia artificial chino llamado Z.ai lanzó un modelo llamado GLM-5.2 que, en tests de capacidad, está casi al mismo nivel que GPT-5.5 de OpenAI y Claude Opus de Anthropic. Estos sistemas son los más avanzados que existen ahora mismo.

Lo inusual es que GLM-5.2 es «de código abierto» o «de peso abierto»: cualquiera puede descargarlo y ejecutarlo en su ordenador. No necesitas permiso, no pagas nada, nadie puede verlo.

Una organización de seguridad llamada SaferAI lo probó con tareas de ataque informático y biología sintética. El modelo chino aceptó hacer todas. Claude, en comparación, se negó tantas veces que ni siquiera pudieron completar las pruebas.

Por qué debería importarte

Un modelo de IA potente que rechaza hacer cosas peligrosas es como un arma con un sistema de bloqueo: puedes retirarla si es necesario. Pero si alguien descarga el código fuente y lo ejecuta en su casa, puede abrir el arma, quitar el sistema de bloqueo, y usarla como quiera.

El riesgo es real: un modelo así en manos de un atacante criminal o un actor estatal podría usarse para diseñar malware, encontrar vulnerabilidades informáticas o ayudar a crear armas biológicas. Hasta ahora, OpenAI y Anthropic evitaban liberar modelos tan potentes precisamente por esto.

Lo que ha cambiado es que China está ganando la carrera de inteligencia artificial y decidió compartir su código. Eso acelera la innovación global, pero también democratiza herramientas que podrían ser muy peligrosas.

La imagen muestra la tensión entre acceso y seguridad en la IA moderna. Mientras que cerrar completamente la puerta (acero) limita el progreso, abrir sin restricciones (cristal transparente) permite que fluyan riesgos sin control. El modelo chino de código abierto representa esa puerta de cristal: tan avanzado como la competencia, pero sin los controles que frenan usos peligrosos.
La imagen muestra la tensión entre acceso y seguridad en la IA moderna. Mientras que cerrar completamente la puerta (acero) limita el progreso, abrir sin restricciones (cristal transparente) permite que fluyan riesgos sin control. El modelo chino de código abierto representa esa puerta de cristal: tan avanzado como la competencia, pero sin los controles que frenan usos peligrosos. Ilustración propia, generada desde el concepto

Cómo intentan frenar el peligro (y por qué casi no funciona)

OpenAI y Anthropic usan tres técnicas para que sus modelos rechacen órdenes dañinas: clasificadores (un sistema que señala «esto es peligroso»), rechazo entrenado («te enseñamos a decir que no»), y controles en la API (filtros en el servidor central).

Esos filtros funcionan mientras el modelo está en los servidores de la empresa. Pero con GLM-5.2, esos filtros son inútiles. Es como cerrar con llave la puerta de tu casa cuando ya te has ido: quien tenga las llaves puede entrar y cambiar la cerradura.

Incluso los modelos de OpenAI tienen agujeros: investigadores encontraron cientos de «jailbreaks» —trucos que engañan al modelo para que haga lo que debería rechazar— que funcionan en casi cualquier solicitud peligrosa. Los atacantes combinan varias técnicas: fingen ser otra persona, mienten sobre el contexto, usan historiales de conversación falsos.

La idea que podría ayudar (pero es muy difícil)

SaferAI propone una técnica llamada «filtrado de datos de preentrenamiento»: eliminar información peligrosa de los datos con los que entrenar el modelo. Es como si enseñaras a un médico usando solo libros que no mencionen cómo envenenar a alguien.

Funciona mejor para biología (puedes entrenar un modelo que sepa medicina sin que sepa diseñar patógenos). Pero para programación informática es casi imposible: la misma habilidad que te hace un buen programador te hace un buen hacker. Como la destreza manual es lo mismo para operar que para robar.

Las empresas estadounidenses ahora se centran en otras soluciones: hacer que el modelo solo ayude con ciertos tipos de código, pero no otros; publicar evaluaciones de riesgos antes de lanzar; incluso retener los pesos (no liberar el código) si creen que es demasiado peligroso.

Por qué China hace las cosas diferentes

Los reguladores chinos saben que la IA es poderosa. Su presidente Xi Jinping acaba de subrayar que quieren modelos abiertos, pero bajo «control humano estricto». China tiene regulaciones de inteligencia artificial, pero históricamente se han enfocado en censura política y desinformación, no en riesgos de seguridad técnica.

Un investigador de Stanford nota que los pensadores estadounidenses están más obsesionados con riesgos catastróficos (una IA muy peligrosa), mientras que la comunidad china confía más en que pueden controlar el uso dentro de sus fronteras. En China, tu actividad en línea está ligada a tu identidad real, y las empresas pueden ser responsabilizadas.

El problema: como China coordina con reguladores en privado, es difícil saber qué pruebas de seguridad hizo Z.ai antes de soltar GLM-5.2. TechCrunch preguntó, pero Z.ai no respondió.

El argumento contrario: la defensa también necesita IA potente

Hugging Face (una plataforma que aloja modelos de IA) argumenta que necesitaban GLM-5.2 para defenderse cuando OpenAI fue hackeada recientemente. Su CEO dice que los mismos sistemas que detienen un ataque pueden usarse para defenderse contra millones cada día.

Es verdad que los defensores usan modelos de IA para buscar vulnerabilidades antes de que los atacantes las encuentren. Pero SaferAI contrapone: eso no significa que haya que liberar todas las capacidades peligrosas. Debería ser al revés: libera solo lo «bueno» y guarda lo «malo».

El problema real es la velocidad: un grupo criminal puede cambiar de método en una semana. Un hospital tarda meses en parchear sus sistemas. Los atacantes siempre sacan más rápido partido de herramientas nuevas que los defensores.

Dónde estamos ahora

La brecha entre lo que saben hacer estos modelos y cómo podemos evitar que se usen para el mal es cada vez más grande. Los modelos más poderosos del mundo ahora pueden cometer actos peligrosos; algunos con salvaguardas débiles, otros sin ninguna.

El debate ya no es «¿pueden competir los modelos abiertos con los de frontera?». Ganaron esa carrera. Ahora es: «¿cómo convivimos con herramientas tan potentes en manos de cualquiera?». Y esa es una pregunta para la que todavía no hay respuesta clara.

Todo en una frase

Un modelo de IA chino de código abierto alcanzó el nivel técnico de los mejores del mundo pero rechaza hacer cosas peligrosas mucho menos que sus rivales, exponiendo el dilema central de la IA moderna: cuanto más la compartimos, menos control tenemos sobre cómo se usa.

Esta pieza es una adaptación en español con redacción propia del artículo original «Open-weight AI models are catching up to the frontier. The safety gap remains.» (TechCrunch AI). Las cifras son las del original; para el detalle completo, ve a la fuente.
← volver al blog