Los Modelos de Lenguaje Grande (LLMs) como ChatGPT, Gemini o Copilot entre otros han transformado la forma en que interactuamos con la inteligencia artificial, pero ¿Qué pasa cuando estas poderosas herramientas se convierten en un blanco para los atacantes?
Los chatbots mencionados se basan en LLM (Del inglés: Modelos de Lenguaje Grande)
Son una forma de inteligencia artificial generativa que entiende y genera texto. Útil para el propósito de un chatbot, entender un texto humano y generar una respuesta. Esta tecnología esta basada en datos de entrenamiento, es decir, se les pasa información para que aprendan.
Un ejemplo básico de esto sería pasar una biografía de un personaje para aprender acerca del mismo. O pasarle este articulo para aprender de IA, como esta haciendo el lector. La manera de aprendizaje es similar al humano.
-Como funciona un LLM
De manera simplificada, al LLM se le proporciona un texto el cual lo descompone en palabras que las convierte en vectores llamados embeddings. Estos vectores representan la relación de palabras.
Para hacer una mejor compresión del texto, las redes neuronales emplean la arquitectura de Transformador, la cual analiza la secuencia de palabras. Usando “Atención” el mecanismo que permite enfocarse en las partes más relevantes del texto. El transformer no deja de estar basado en probabilidades, por eso los modelos no nos entrega la misma respuesta a una misma pregunta.
A la hora de generar texto debido al entrenamiento (que se realiza el proceso que hemos detallado) los LLMs pueden predecir la siguiente palabra en una secuencia.
-Algunas de sus vulnerabilidades
Como todas las tecnologías siempre existen vulnerabilidades. Estos modelos sufren alucinaciones recordando que no debemos tener una dependencia absoluta.
Según OWASP algunas de las vulnerabilidades más importantes son:
- Prompt Injection
Una de las más conocidas, por la cual el atacante con el prompt adecuado consigue alterar el comportamiento esperado del modelo.
- Unbounded Consumption
Similar a un DDOS busca agotar los recursos del modelo. Suele pasar más desapercibido este ataque debido a que estos modelos trabajan con grandes cantidades de recursos.
En muchas ocasiones no se produce un colapso total del servicio simplemente se consigue que el LLM “tenga fiebre” es decir producir una saturación.
- Excessive Agency
Los modelos LLMs pueden realizar ciertas acciones automáticas en respuesta a un prompt.
La Agencia excesiva si se ha producido un ataque o el modelo ha sufrido una alucinación en ese grado de actuación podría no tomar las mejores decisiones como revelar información confidencial.
Estas son las más interesantes, la guía de OWASP nos muestras otras 7 más.
– Algunas técnicas de explotación
Vistas las vulnerabilidades toca explotarlas.
- Ofuscación
Consiste en alterar el texto del prompt para engañar el filtro del modelo.
Hay muchas maneras como intercalar letras mayúsculas/minúsculas con números etc.
Este tipo de escritura se conoce como leet speak.
- Context Compliance Attack (CCA)
Este método probablemente algo similar a la ingeniería social con las personas consiste en enviar previamente los prompts adecuado “para ganarnos la confianza” del modelo y así obtener la respuesta deseada por el atacante.
-Conclusión
Los modelos LLM no dejan de estar entrenados por información humana. Esto ha hecho que muchas técnicas y vulnerabilidades ya presentes se hayan instalado a esta tecnología.
Debemos monitorear las respuestas de los modelos ya que también son vulnerables. Aplicar control de privilegios.
Los procedimientos descritos en este post solo son con fines de informar. No nos hacemos responsable del uso que se le puede hace.
Agradecer a Marco Carrasco Talán y Katherine D. por el material cedido.
Esperemos que haya sido de vuestro interés, nos vemos en el siguiente.
