Equipo de Oscilar

Cómo evaluar un agente de riesgo de IA antes de su puesta en producción

Publicado

Publicado

Equipo de Oscilar
Contenido

Comparte este artículo

Última actualización: septiembre de 2026

La demostración fue buena. Ese suele ser el punto de partida honesto, y vale la pena decirlo con claridad en lugar de tratar la demo como un truco. Alguien le mostró a un agente resolviendo una alerta, razonó con sensatez, llegó a la conclusión a la que habría llegado su equipo y lo hizo en una fracción del tiempo.

Ahora debe decidir si ese agente tiene cabida en producción, donde usted es el responsable de lo que decida. Y la parte incómoda es que una demo responde a una pregunta que realmente no necesitaba responder. Muestra que el agente puede acertar una vez, en una alerta que alguien eligió. La producción se pregunta si mantiene el acierto en todas sus tipologías, si se puede explicar cualquier decisión individual nueve meses después y quién responde cuando se equivoca.

Hay una distinción útil debajo de todo esto: un modelo se monitorea, un agente se evalúa. Un modelo produce una puntuación que se puede contrastar con una etiqueta. Un agente sigue una secuencia de pasos (recopilar pruebas, llamar a herramientas, sopesar lo que encontró, llegar a una resolución) y, por lo general, no hay una etiqueta para nada de eso. Lo que tiene en su lugar es lo que habrían hecho sus analistas. Eso resulta ser suficiente y también es lo que hace que esto sea evaluable por un equipo de riesgos sin necesidad de un área de ciencia de datos.

En resumen

  • Una demo demuestra un resultado único. La producción exige un rendimiento sostenido, reconstrucción de decisiones, gobernanza y encaje operativo.

  • Evalúe a un agente en función de las decisiones que toman sus propios analistas, no de una puntuación de precisión abstracta. Rara vez existe una etiqueta de verdad absoluta; existe un juicio humano competente.

  • Cuatro dimensiones: rendimiento sostenido, reconstrucción de decisiones, gobernanza y aprobación, y encaje operativo.

  • El método es el funcionamiento en paralelo. El agente y el analista trabajan en la misma fila; la comparación es la evaluación.

  • No necesita un equipo de aprendizaje automático. Necesita decisiones humanas etiquetadas, que son sus casos cerrados.

  • Sepa qué medir y luego establezca sus propios límites.

  • La evaluación no termina con la puesta en marcha. Los agentes se degradan por razones que los modelos no experimentan.

Qué es la evaluación de agentes de IA

La evaluación de agentes de IA es la práctica de determinar si las decisiones de un agente se mantienen a lo largo del tiempo frente a los juicios que tomaría su propio equipo, y si cada decisión puede explicarse y reconstruirse a posteriori.

Se diferencia de la validación de modelos en un aspecto específico. Validar un modelo significa comprobar sus resultados frente a respuestas correctas conocidas en un conjunto de datos reservado. Un agente no tiene un resultado único que comprobar: tiene una trayectoria. Decidió qué pruebas recopilar, decidió que lo que recopiló era suficiente y llegó a una resolución. Una ejecución puede llegar a una conclusión defendible a través de un razonamiento que usted no aceptaría, y puede llegar a la conclusión equivocada a través de un razonamiento que era sólido hasta que faltó un dato de entrada.

La consecuencia práctica: evaluar un agente que usted no construyó es un trabajo diferente al de instrumentar uno propio. La mayoría de las guías publicadas se dirigen a ingenieros que construyen agentes y eligen entornos de prueba. Si usted es el responsable de riesgos que decide si acepta el agente de un proveedor en un proceso regulado, necesita un conjunto de preguntas diferente.

Lo que una demo no puede mostrarle

Nada de esto significa que la demo haya sido engañosa. Significa que una demo y una decisión en producción son objetos diferentes.

Lo que mostró la demo

Lo que la producción realmente exige

Produjo una buena respuesta para esta alerta

¿Coincide con sus analistas en todas sus tipologías, a lo largo de las semanas, en su cartera?

Explicó su razonamiento, en pantalla, ahora mismo

¿Puede reconstruir por qué decidió esto dentro de nueve meses, con los datos de entrada tal como estaban en ese momento?

Funcionó con la muestra

¿Se mantiene a medida que cambian sus datos, políticas, tipologías y límites?

Alguien lo ejecutó para usted

¿Quién es el propietario de la decisión cuando es incorrecta y qué pasa con la fila de sus analistas?

La columna de la derecha es la evaluación. Cada fila es una dimensión y ninguna de ellas se puede responder en una reunión.

Las cuatro cosas que hay que evaluar

Trate estas preguntas como las que debe plantear a un proveedor, y a su propio equipo sobre su preparación para juzgar las respuestas.

1. Rendimiento sostenido. ¿Coincide el agente con sus analistas, segmentado por tipología, a lo largo de un período de tiempo en lugar de una sola sesión? La coincidencia agregada oculta lo que realmente le importa: una única tipología en la que el agente se equivoca sistemáticamente. Pregunte cómo se mide la coincidencia, con qué volumen y si puede ver los desacuerdos de forma individual.

2. Reconstrucción de decisiones. ¿Puede recuperar, meses después, qué vio el agente y por qué concluyó lo que concluyó? No un resumen generado a posteriori, sino las pruebas tal como estaban, guardadas con la decisión. Vale la pena ver cómo se ven realmente una fila de alertas y una pista de auditoría antes de evaluar la de cualquiera, para saber qué está pidiendo.

3. Gobernanza y aprobación. ¿Existe un límite operativo definido para el agente, un punto de aprobación humana y un registro de ambos? Todo lo que su función de riesgo de modelos pida al validar un modelo, lo pedirá aquí, y los entregables son los mencionados anteriormente.

Esta es la dimensión en la que el terreno regulatorio acaba de cambiar, y lo hizo en una dirección que da más peso a su evaluación, no menos. El 17 de abril de 2026, la OCC, la Reserva Federal y la FDIC reemplazaron la carta sobre riesgo de modelos de 2011 (SR 11-7) con una guía revisada emitida como SR 26-2, Boletín OCC 2026-13 y FDIC FIL-15-2026. La nueva guía sitúa explícitamente a la IA generativa y de agentes fuera de su alcance, bajo el argumento de que tales modelos son "novedosos y evolucionan rápidamente", e insta a las instituciones a confiar en su lugar en sus prácticas más amplias de gestión de riesgos y gobernanza. Las agencias también señalaron que planean una solicitud conjunta de información sobre el uso de la IA por parte de los bancos. Esa solicitud aún no se ha emitido. La guía se dirige principalmente a bancos con activos superiores a los 30,000 millones de dólares, pero en la práctica las expectativas se trasladan hacia abajo.

Lea eso con atención, porque es fácil interpretarlo como un alivio y no lo es. Que la IA de agentes esté fuera del alcance regulatorio no significa que esté fuera de la vista. Los examinadores seguirán preguntando cómo probó al agente, cómo lo monitorea y dónde se sitúa la supervisión humana. Lo que ha cambiado es que no hay un marco publicado para responderles, lo que significa que el registro de su evaluación es la respuesta. Una institución que realizó una evaluación estructurada tiene algo que mostrar. Una que confió en la demo del proveedor tiene una explicación pendiente.

4. Encaje operativo. ¿Cómo se ve la fila del analista la semana posterior a la puesta en marcha? ¿Quién revisa el resultado, cómo discrepa un analista del agente y a dónde va a parar ese desacuerdo? Un agente que es preciso pero operativamente inviable no sobrevive a su primer trimestre.

Por qué el punto de referencia son sus analistas, no una puntuación de precisión

Este es el replanteamiento que hace que todo el proceso sea manejable, y merece su propia sección porque es la parte en la que la gente suele estancarse.

Para la mayoría de las decisiones de riesgo no existe una verdad absoluta. El hecho de que una alerta determinada debiera haber sido escalada no es un dato guardado en una base de datos: es un juicio, emitido por una persona capacitada, conforme a una política. Por lo tanto, la pregunta medible no es "¿estuvo en lo correcto el agente?", sino "¿llegó el agente a la misma resolución que un analista competente y, si no fue así, por qué?".

Eso tiene dos consecuencias en las que vale la pena detenerse. La primera es práctica: usted ya tiene los datos de evaluación. Cada caso cerrado es una decisión humana etiquetada. No necesita construir un conjunto de pruebas; necesita dirigir al agente hacia el que ya tiene.

La segunda es que no necesita un equipo de aprendizaje automático para ejecutar esto. Las tasas de coincidencia y la revisión de desacuerdos son tareas de operaciones de riesgo, no de ciencia de datos. El equipo que ya realiza el control de calidad de las decisiones de los analistas puede realizar el control de calidad de las decisiones de los agentes.

Una advertencia honesta: sus analistas no son infalibles. Un desacuerdo es un aviso para investigar, no una prueba de que el agente esté equivocado. Algunos de los hallazgos más útiles en estos ejercicios son casos en los que el agente tenía razón y la resolución original no.

Cómo ejecutar la evaluación

La evaluación no es un evento que ocurre antes del despliegue. Es un período de funcionamiento en paralelo.

Comience comparando con su historial. Ejecute el agente sobre un conjunto de alertas cerradas de las que ya sabe qué decidió su equipo. Esto es de bajo costo, no afecta a nada en producción y le indica si una prueba en vivo vale el tiempo de su equipo. Oscilar estructura esto como la fase de apertura de una alianza de diseño: primero el acceso a los datos y la definición del alcance del flujo de trabajo, luego la evaluación frente a un conjunto etiquetado de sus propios casos cerrados.

Luego, el modo sombra (shadow mode). El agente trabaja en la fila en vivo junto a sus analistas sin decidir nada. Su analista toma su decisión con normalidad y luego dedica un par de minutos adicionales a ver a qué conclusión llegó el agente y si está de acuerdo. Ese esfuerzo adicional es real, y esa es la evaluación. Se ejecuta durante semanas, no meses.

Luego, el control de calidad adicional. Un proceso de control de calidad aplicado a las decisiones del agente es en sí mismo una evaluación con intervención humana, y es la forma en que se construye la confianza en lugar de simplemente afirmarla. Tomar muestras de las decisiones del agente de la misma manera que se toman muestras de las decisiones de los analistas le ofrece una medición continua en lugar de un veredicto único. Aplicar ese procedimiento de control de calidad a cada decisión del agente en lugar de a una muestra es una línea de desarrollo activa en lugar de algo disponible hoy en día; el atractivo radica en que si cada decisión supera una verificación constante, la muestra humana puede reducirse, porque se está evaluando la verificación en lugar del resultado bruto.

Por último, una sesión de conclusiones, con una decisión humana al final. Alguien analiza los porcentajes de coincidencia, los patrones de desacuerdo y las comprobaciones aleatorias de reconstrucción, y decide qué se deriva al agente (si es que se deriva algo) para una revisión de primera pasada. Esa decisión pertenece a una persona designada. Tenga en cuenta lo que no es: el agente no publica una resolución. La decisión del analista se mantiene y la estructura de creador-verificador no cambia. Lo que cambia es la cantidad de recopilación y análisis que llega ya preparada.

Para tener una idea de cómo se ve el resultado final: un banco regional en fase de despliegue está viendo un 92% de coincidencia del agente con su equipo de analistas en la resolución de alertas, con total aprobación humana, y una reducción del 75% en el tiempo de revisión de los analistas. La coincidencia con los analistas es exactamente la métrica que defiende este artículo, razón por la cual ese número es el relevante en lugar de una puntuación de referencia.


Qué medir

Categorías, no objetivos. Cualquiera que le entregue su propia nota de aprobación le está vendiendo algo.

Medida

Lo que le indica

Cosas a vigilar

Tasa de coincidencia con las resoluciones de los analistas

La señal principal

Cifras globales que ocultan una mala tipología

Dónde se agrupan los desacuerdos

Qué tipologías o segmentos gestiona mal el agente

Denominadores pequeños en tipologías poco comunes

Integridad de la reconstrucción

Si puede presentar el historial completo de pruebas para una decisión muestreada

Resúmenes que sustituyen a las pruebas guardadas

Tiempo del analista por caso

Si el beneficio operativo es real

Tiempo que se traslada en lugar de reducirse

Calidad de los escalamientos

Si los escalamientos son mejores, no simplemente menos numerosos

El volumen tratado como un indicador de calidad

Establezca sus propios límites en función de su propio apetito de riesgo. Los criterios de aceptación para una prueba de concepto (lo que constituye una aprobación) es un ejercicio independiente y debe quedar por escrito antes de que comience la prueba, no negociarse después de conocer los resultados.

Una trampa relacionada, y muy real: una métrica sin una definición acordada debajo es peor que no tener ninguna métrica. Si la "coincidencia" no se define con precisión antes de la prueba, el número que obtenga al final no significará nada y cada persona lo interpretará de forma diferente.

Errores comunes

Evaluar únicamente la respuesta final. La resolución puede ser correcta aunque la trayectoria haya sido errónea, lo que significa que fallará en la siguiente alerta que difiera ligeramente.

Evaluar una sola vez, antes de la puesta en marcha, y nunca más. Este es el error con mayores consecuencias. Un agente puede degradarse porque sus políticas cambiaron, sus tipologías variaron o sus propias instrucciones fueron editadas, y nada de eso afecta al modelo subyacente. La desviación en los sistemas de agentes merece su propio tratamiento, y una evaluación que se detiene en la puesta en marcha no la detectará.

Medir con un conjunto etiquetado que no sea su cartera de clientes. La referencia de un proveedor le habla de los datos de ese proveedor.

Aceptar una métrica sin definición. Ver arriba.

Tratar una buena demo como prueba de encaje operativo. Son propiedades que no están relacionadas. La demo no dice nada sobre lo que ocurre con su fila de trabajo.

Dónde es importante la plataforma

Un punto estructural, porque determina si dos de las cuatro dimensiones tienen siquiera respuesta.

La reconstrucción y la medición sostenida son propiedades de la capa que está debajo del agente, no del agente mismo. Si las pruebas que utilizó un agente se recopilaron de varios sistemas en el momento de la decisión y nunca se guardaron de forma unificada, no podrá reconstruirlas más tarde; solo podrá volver a ejecutarlas, lo cual no es lo mismo y no convencerá a nadie que lo revise.

Por eso la capa de decisión es importante para una evaluación que nominalmente trata sobre agentes. En una plataforma unificada, la decisión, sus pruebas y su razonamiento se guardan juntos porque hay un solo lugar para almacenarlos. Cuando evalúe a cualquier proveedor, pregunte dónde vive el registro de la decisión y si es un registro único.

Si desea ver los agentes a los que se aplica esto, el Centro de Agentes (Agent Hub) es el lugar para comenzar.

Preguntas frecuentes

¿Qué es la evaluación de agentes de IA?

La evaluación de agentes de IA es la práctica de determinar si las decisiones de un agente se mantienen a lo largo del tiempo frente a los juicios que tomaría su propio equipo, y si cada decisión puede explicarse y reconstruirse a posteriori. Se diferencia de la validación de modelos porque un agente produce una trayectoria de razonamiento y acciones en lugar de un único resultado medible.

¿Cómo se evalúa a los proveedores de IA de agentes para el sector bancario?

A través de cuatro dimensiones: coincidencia sostenida con sus analistas segmentada por tipología, capacidad de reconstruir cualquier decisión meses después con las pruebas tal como estaban, un límite operativo definido con aprobación humana registrada y encaje operativo con su fila de analistas. Ejecútelo primero contra un conjunto etiquetado de sus propios casos cerrados, luego en modo sombra en la fila en vivo, y establezca sus propios límites de aceptación antes de que comience la prueba.

¿Por qué los métodos de evaluación tradicionales son insuficientes para los sistemas de IA de agentes?

La validación tradicional de modelos compara un resultado con una etiqueta conocida como correcta. Un agente realiza una secuencia de pasos sin una etiqueta única: elige qué pruebas recopilar, juzga si son suficientes y llega a una resolución. Se puede llegar a una conclusión defendible a través de un razonamiento inaceptable, por lo que evaluar solo la respuesta final pasa por alto la mayor parte de lo que ocurrió.

¿Se puede evaluar un agente de riesgos de IA sin un equipo de ciencia de datos?

Sí. Dado que el punto de referencia es la coincidencia con las decisiones de sus analistas en lugar de una puntuación de precisión abstracta, los datos de evaluación son sus casos cerrados y el trabajo es de operaciones de riesgo más que de ciencia de datos. El equipo que ya realiza el control de calidad de las decisiones de los analistas puede realizarlo en las decisiones de los agentes.

¿Cuánto debería durar la evaluación de un agente de IA?

Planifique en meses, no en semanas. La ejecución contra sus casos cerrados es rápida. El modo sombra necesita el tiempo suficiente para cubrir una variedad representativa de tipologías y demostrar si la coincidencia es estable o es solo una primera impresión; además, una alianza de diseño completa desde el inicio hasta la puesta en marcha suele durar unas doce semanas. No termina con la puesta en marcha; los agentes necesitan una medición continua porque se degradan por razones que nunca afectan al modelo.

¿Cómo se regulan la revisión humana, la auditabilidad y el rendimiento de los agentes?

A través de un límite operativo definido para el agente, un punto de aprobación humana que forma parte del registro de la decisión, una pista de auditoría que guarda las pruebas y el razonamiento de cada decisión, y una comparación continua con las decisiones humanas. Desde abril de 2026, la guía revisada sobre riesgo de modelos de las agencias excluye a la IA generativa y de agentes de su alcance, por lo que esto se sitúa bajo su marco más amplio de gestión de riesgos y gobernanza en lugar de bajo la validación de modelos, lo que convierte al registro de evaluación que usted construya en la prueba principal de supervisión.

Equipo de Oscilar

El equipo de Oscilar está formado por expertos en diversas áreas de gestión de riesgos. Estos artículos reflejan las opiniones y conocimientos de una gran variedad de colaboradores de toda nuestra organización.

Sigue leyendo