Por Oluwole Akinwale, Director de Professional Services
Podrías usar un asistente de IA para redactar correos electrónicos, resumir mensajes o ayudarte con las compras en línea. Probablemente confías en que haga exactamente lo que le pediste, ¿no es así?
Pero, ¿qué pasa si alguien se las arregló para colar instrucciones secretas sin que lo sepas?
La inyección de prompts es una forma sigilosa de engañar a la IA al ocultar comandos en el contenido que lee. Al hablar de ciberseguridad, la “inyección” se refiere a insertar algo en un flujo existente. Por lo tanto, la inyección de prompts toma tu prompt, o la entrada que le das a una IA, e inserta instrucciones ocultas en la entrada de la IA. Piensa en ello como alguien que le susurra instrucciones falsas a tu asistente antes de que hables, y el asistente las sigue en lugar de escucharte.
Cómo funciona la inyección de prompts
La inyección de indicaciones explota cómo la IA lee el texto. Los modelos de IA a menudo tienen dificultades para diferenciar lo que el usuario pidió, lo que el desarrollador pretendió y lo que un actor malicioso insertó sigilosamente.
Si la IA ve instrucciones dañinas que parecen texto normal, podría seguirlas. Imagina que usas una IA para administrar tu calendario y recibes una invitación por correo electrónico. El correo parece ser de un colega, pero contiene instrucciones ocultas para que la IA agregue una reunión con detalles incorrectos, lo que interrumpe tu agenda. Hay dos formas principales en que esto sucede:
- Inyección directa: Un usuario escribe instrucciones que manipulan directamente a la IA.
- Inyección indirecta: Alguien oculta comandos dentro de algo que la IA lee, como un correo electrónico, una página web o un documento.
Este tipo de cosas ya están sucediendo en la vida real:
Los resúmenes de IA de Gmail fueron engañados por comandos ocultos.
La IA de Gmail puede resumirte correos electrónicos largos. En 2025, los investigadores descubrieron que los atacantes podían ocultar texto invisible en un correo electrónico, como usando una fuente blanca sobre un fondo blanco, con instrucciones secretas. La IA siguió esas instrucciones ocultas y proporcionó resúmenes engañosos, incluso cuando el correo electrónico era arriesgado o engañoso.
Un chatbot fue engañado para que ofreciera un auto de $76,000 por $1
En diciembre de 2023, Chris Bakke visitó el sitio web de un concesionario de Chevrolet e hizo algo que resultó a la vez divertido y un poco preocupante. Con solo unos cuantos mensajes ingeniosos, logró que el chatbot impulsado por ChatGPT aceptara venderle un Chevy Tahoe de $76,000 por $1.
Por qué importa
La inyección de prompts no se infiltra en tu sistema como lo haría el malware. En cambio, se apodera de la conversación entre tú y la IA. Dado que la IA trata el texto como instrucciones, un prompt dañino puede eludir las protecciones del desarrollador si el modelo no puede distinguir los mensajes seguros de las entradas de un atacante.
Esto significa que incluso las herramientas cotidianas pueden ser obligadas a actuar de formas extrañas si alguien conoce los trucos adecuados.
Qué puedes hacer como usuario
Mientras los desarrolladores trabajan constantemente para crear mejores defensas, tú puedes protegerte mientras tanto haciendo lo siguiente:
1. Ser cauteloso con la entrada de IA.
Evita pegar texto o documentos no confiables.
2. Observar comportamientos extraños.
Si la IA empieza a actuar de forma extraña, no la ignores. También puedes reportar la anomalía a través de los canales apropiados, ayudando a salvar a miles o incluso millones de otros usuarios.
3. Elige herramientas de confianza.
Utilice servicios de IA y plugins de proveedores reconocidos que se actualicen con frecuencia y prioricen la seguridad. Para asegurarse de que una herramienta es confiable, busque actualizaciones recientes o verifique si el proveedor lanza parches con frecuencia. Además, esté atento a insignias de seguridad o certificaciones que indiquen pruebas rigurosas de privacidad y protección de datos.
Estos pasos te empoderan para tomar decisiones más seguras y mantener el control sobre tus interacciones con IA.
En resumen
La inyección de prompts es similar a la ingeniería social, que implica engañar a las personas para que revelen información importante. Pero para la IA, no necesita una contraseña; solo necesita las palabras correctas en el lugar correcto.
Afortunadamente, cuanto más lo entendemos, más fácil es notar cuándo algo no está bien. Estar al tanto es tu primera defensa y ayuda a asegurar que tu asistente digital trabaje para ti, no para alguien más.