Servicios de IA implementados con criterio

Solicitar presupuesto

Cómo evitar que un agente de IA haga algo que no debería

Por qué los prompts no son suficientes y qué controles necesita un agente en producción

Daniel Riera
Daniel RieraResponsable Editorial en DelegIA
21 de julio de 20269 min1862 palabras

Un agente de IA en producción no solo responde preguntas. Ejecuta acciones: escribe en bases de datos, envía correos, actualiza registros en el CRM, genera documentos que salen al cliente. La diferencia entre un agente que ayuda y uno que crea problemas está, en gran medida, en lo que se pone entre la decisión del agente y la ejecución de esa decisión.

Eso son los guardrails: las capas de validación, filtrado y control que determinan qué puede hacer el agente y qué no, independientemente de lo que el modelo decida en un momento dado. No son un componente opcional que se añade cuando ya hay un incidente. Son parte del diseño desde el primer día.

Esta guía describe qué son los guardrails para agentes de inteligencia artificial, por qué los prompts solos no son suficientes para controlarlos, y qué tipos de guardrails necesita un sistema que opera en producción dentro de una empresa.

Índice del artículo

Por qué un buen prompt no es suficiente para controlar un agente#

La intuición habitual es que si las instrucciones del prompt están bien redactadas, el agente se comportará bien. Esto funciona en demos. En producción, falla por razones estructurales.

Escena operativa para Cómo evitar que un agente de IA haga algo que no debería

Un modelo de lenguaje no valida sus propias salidas. Puede generar texto incorrecto, extraer datos equivocados o decidir ejecutar una acción que el prompt desaconsejaba, especialmente cuando el agente encadena varias decisiones o interactúa con herramientas externas.

Cuantos más pasos tiene la cadena de razonamiento, más probabilidad de que el modelo tome un camino que el diseñador del prompt no anticipó.

El prompt define intenciones. Los guardrails definen límites que el sistema no puede cruzar, independientemente de lo que el modelo decida.

La distinción es crítica: un agente sin guardrails puede hacer exactamente lo que el modelo considera correcto, aunque eso sea exactamente lo que la empresa no quiere que haga. Enviar un correo a un cliente con datos internos. Borrar un registro que no debía tocarse. Escalar una queja sin validar si el criterio de escalada se cumplía.

Los cinco tipos de guardrails que necesita un agente en producción#

Los guardrails no son un mecanismo único. Son una familia de controles que operan en distintos momentos del ciclo de vida de una consulta al agente.

Mapa visual del sistema para Cómo evitar que un agente de IA haga algo que no debería

1. Filtros de entrada (input filters)

Actúan antes de que el modelo procese la consulta del usuario. Detectan y bloquean o transforman entradas problemáticas:

  • Redacción de PII (datos personales identificables). Si el agente no debe procesar datos personales directamente, el filtro de entrada los anonimiza antes de que lleguen al modelo.
  • Detección de prompt injection. Ataques donde el usuario intenta inyectar instrucciones en el input para que el agente ignore sus instrucciones originales y ejecute las del atacante. En agentes que procesan contenido externo (emails, documentos de terceros), este riesgo es elevado.
  • Clasificación de intención. Detectar si la consulta pertenece al dominio del agente o si es una solicitud fuera de alcance que debería rechazarse antes de consumir tokens en el modelo.

2. Filtros de salida (output filters)

Actúan sobre lo que el modelo ha generado, antes de que esa salida llegue al usuario o se use como input de la siguiente acción:

  • Verificación de alucinaciones. Para outputs que deben ser factuales (datos de producto, políticas, precios), un segundo proceso verifica que la información generada coincide con la fuente de verdad.
  • Detección de toxicidad y contenido inapropiado. En agentes que interactúan con clientes externos, esto es un requisito operativo básico.
  • Validación de formato. Si la salida del agente debe seguir una estructura específica (JSON, tabla, formato de contrato), el filtro verifica que la estructura sea correcta antes de pasar al siguiente paso.

3. Guardrails de acción (action guardrails)

El tipo más crítico para agentes que ejecutan acciones sobre sistemas reales. Controlan qué herramientas puede invocar el agente y bajo qué condiciones.

Funcionan con listas de herramientas permitidas (whitelist) y herramientas bloqueadas (blacklist). Un agente de soporte puede consultar el CRM pero no puede modificar datos de facturación. Un agente de contenido puede crear borradores pero no puede publicar directamente sin revisión humana.

Los guardrails de acción son la diferencia entre un agente que asiste y uno que puede causar daño irreversible. Borrar un registro, enviar una comunicación masiva, modificar permisos de acceso son acciones que requieren guardrails de acción explícitos, no confianza en que el modelo "decidirá bien".

4. Guardrails de política (policy guardrails)

Codifican las reglas de negocio que el agente debe respetar. No son reglas técnicas, son criterios del negocio:

  • El agente no puede ofrecer descuentos superiores al 15% sin aprobación humana.
  • El agente no puede escalar una queja a la categoría de incidente sin que se cumplan los criterios definidos.
  • El agente no puede generar documentación para clientes en estado de impago.

Los guardrails de política son los que más frecuentemente se omiten en las primeras implementaciones, porque "están en el prompt". En producción, cuando el agente encadena decisiones, las reglas del prompt se difuminan. Las reglas de negocio críticas necesitan validación independiente del modelo, no solo instrucciones.

5. Guardrails de tasa (rate guardrails)

Limitan el volumen de operaciones que el agente puede ejecutar en un período de tiempo. Protegen contra bucles infinitos donde el agente llama a una herramienta repetidamente, contra ataques de denegación de servicio, y contra errores de configuración que generan llamadas en cadena no previstas.

Un agente de generación de contenido que entra en un bucle y genera 2.000 variantes de un texto en diez minutos no solo consume tokens: puede saturar sistemas downstream y generar costes no previstos. Los rate guardrails son el fusible del sistema.

Dónde viven los guardrails en la arquitectura del sistema#

Los guardrails no son una función que se activa en el prompt ni una configuración del modelo. Son componentes independientes que se instalan en capas distintas:

Flujo de control para Cómo evitar que un agente de IA haga algo que no debería

Pre-prompt: el filtro de entrada actúa antes de que la consulta llegue al modelo. El modelo nunca ve la consulta sin procesar.

In-prompt: instrucciones en el system prompt que el modelo debe seguir. Es la capa menos robusta como mecanismo de control, pero es la más fácil de implementar y puede ser suficiente para casos de bajo riesgo.

Post-output: el filtro de salida actúa sobre el output del modelo antes de que llegue al usuario o al siguiente paso de la cadena. El modelo genera, el guardrail verifica.

Pre-acción: antes de invocar una herramienta, el sistema valida que la acción está en la whitelist y que los parámetros cumplen las reglas de política. Este es el punto más crítico para agentes que ejecutan acciones sobre sistemas externos.

En una infraestructura bien diseñada, estos cuatro puntos operan como capas independientes. Si una falla, las demás siguen activas. El principio que guía el diseño es la defensa en profundidad.

Los enfoques de implementación: reglas, LLM como juez, e híbrido#

Hay tres formas de implementar la lógica de validación dentro de un guardrail:

Basado en reglas (rule-based). El guardrail evalúa la consulta o el output contra un conjunto de reglas deterministas: expresiones regulares, listas de palabras bloqueadas, patrones de formato esperado. Es predecible, rápido y auditable. No maneja bien la ambigüedad.

LLM como juez (LLM-as-judge). Un segundo modelo de lenguaje evalúa el output del agente principal antes de que llegue al usuario. El juez puede detectar problemas de tono, coherencia o cumplimiento de política con más flexibilidad que las reglas fijas. El coste: añade latencia y consumo de tokens.

Híbrido. Las reglas deterministas filtran los casos claros. El LLM como juez evalúa los casos ambiguos. Es el patrón más usado en sistemas maduros porque combina la velocidad de las reglas con la flexibilidad del modelo.

La elección depende del nivel de riesgo de las acciones que el agente puede ejecutar y del volumen de consultas. Para un agente de soporte que responde preguntas, el enfoque basado en reglas puede ser suficiente. Para un agente que ejecuta transacciones o genera documentos legales, el enfoque híbrido es el mínimo recomendable.

La pregunta que hay que hacerse antes de instalar guardrails#

La pregunta que dimensiona el nivel de control necesario es directa: ¿qué es lo peor que puede hacer este agente si el modelo toma una decisión equivocada?

Si la respuesta es "enviar un mensaje con datos incorrectos a un usuario", el nivel de control necesario es moderado. Si la respuesta es "modificar datos de facturación", "enviar una comunicación masiva a clientes" o "escalar una incidencia de forma incorrecta", el nivel de control requerido es alto y los guardrails de acción son no negociables.

El dimensionamiento de los guardrails está directamente relacionado con el coste del error. Un agente que solo puede leer datos necesita guardrails de output. Un agente que puede escribir, enviar o modificar datos necesita guardrails de acción en cada operación.

Instalar un agente en producción sin este análisis es el equivalente a contratar a alguien sin definir qué puede decidir solo y qué necesita aprobación. El agente hará lo que pueda hacer. Los guardrails son la definición explícita de sus límites.

Para ver cómo los guardrails se integran en el contexto más amplio de la infraestructura completa, la página de infraestructura de agentes IA describe el enfoque de DelegIA sobre el control de sistemas agenticos en producción.

Preguntas frecuentes

¿Los guardrails reducen la capacidad del agente?+

Depende de cómo se diseñen. Los guardrails bien dimensionados restringen solo lo que no debe hacerse, sin bloquear el funcionamiento normal del agente. El problema aparece cuando los guardrails se diseñan de forma genérica o demasiado restrictiva: entonces el agente se bloquea en casos legítimos.

El diseño de guardrails requiere conocer bien los casos de uso del agente, no aplicar reglas genéricas.

¿Cuánto añaden los guardrails a la latencia del sistema?+

Los filtros basados en reglas añaden milisegundos. Los guardrails que usan un segundo modelo como juez añaden una llamada adicional al LLM, lo que puede suponer entre 500 ms y 2 segundos dependiendo del modelo y el proveedor. En sistemas donde la latencia es crítica, el diseño debe equilibrar el nivel de control con el impacto en el tiempo de respuesta.

¿Los guardrails pueden actualizarse sin modificar el agente?+

Sí, cuando están diseñados como componentes independientes del agente. Esto es una ventaja operativa importante: si una regla de negocio cambia, se actualiza el guardrail sin tocar el prompt ni el modelo. En sistemas donde los guardrails están embedidos en el prompt, cualquier cambio de política requiere modificar el agente.

¿Qué pasa si el agente intenta evadir un guardrail?+

Los modelos de lenguaje no tienen intención de evadir guardrails: generan texto que estadísticamente se ajusta a lo que les han pedido. El riesgo de "evasión" viene de prompt injection por parte de usuarios maliciosos, no del propio modelo. Los filtros de entrada que detectan prompt injection son el mecanismo de defensa para este vector de riesgo.

Fuentes#

Conclusiones

Qué son los guardrails de agentes IA, por qué los prompts no bastan y qué tipos de controles necesita un sistema agentico en producción empresarial.

Si guardrails agentes IA ya aparece dentro de tu empresa, conviene revisar qué parte del flujo debe ejecutar la IA, qué datos necesita y quién valida el resultado antes de escalarlo.

El objetivo no es añadir otra herramienta, sino instalar una infraestructura que reduzca fricción, mantenga control humano y permita medir si el sistema mejora la operación.

El siguiente paso es aterrizar guardrails agentes IA en un caso concreto: qué proceso se quiere mejorar, qué datos lo sostienen y qué parte debe seguir bajo criterio humano.

Si necesitas ayuda para implementar IA en tu empresa con criterio, puedes solicitar un presupuesto y contarnos qué área quieres mejorar. Revisamos el caso y te respondemos en menos de 24 horas.

Albert López

Implementa IA en tu empresa sin improvisar

Analizamos tu caso y te proponemos una infraestructura de IA adaptada al problema real, no un paquete genérico de herramientas.

Solicitar un presupuesto

Comparte este artículo

Daniel Riera

Escrito por

Daniel Riera

Responsable editorial en DelegIA. Documenta la arquitectura de IA que instalamos en empresas de 7 y 8 cifras.

Publicado el 21 de julio de 2026
Volver al blog