Instituciones reguladas por el banco central de Brasil (BACEN)

Cumplimiento y calidad de agentes de IA en empresas reguladas

Axon evalúa las conversaciones reales de tus agentes de IA frente a tu política interna y entrega un dossier defendible: nota por dimensión con margen de error, cada hallazgo con el fragmento literal que lo sostiene y la conclusión firmada por una persona.

Diagnóstico de 4 semanas · evaluación con tu propia clave de IA (BYOK) · PII redactada antes de cualquier procesamiento
B+
Atención · cobranza
Muestra de 384 conversaciones · margen de error del 5%
κ 0,74
Apego a la política
92
Deber de informar
88
Anti-alucinación
74
Evidencia · turno 14

“El cliente pidió el duplicado del recibo 3×, y el agente afirmó que el cobro había sido cancelado, lo que no consta en el sistema.”

El juez corre con tu clave, en el proveedor que tu equipo ya homologó
  • Anthropic
  • OpenAI
  • Google
  • Meta Llama
  • Mistral
  • DeepSeek
Cómo funciona

Auditable en los tres puntos que pregunta el regulador

Contra qué se evaluó, qué sostiene cada hallazgo y quién firmó la conclusión.

  1. La rúbrica es tu políticaLas dimensiones evaluadas salen de tu política interna, versionadas.
  2. Toda cita se verificaEl fragmento literal se coteja con el turno de origen de la conversación.
  3. La conclusión es humanaEl kappa entre tus revisores y el juez sale junto con el resultado.

La rúbrica es tu política

Las dimensiones evaluadas se escriben a mano con tu equipo de riesgo, quedan versionadas, y es contra ellas que cada conversación recibe nota. Nada de criterios genéricos de proveedor.

AInformó el costo efectivo total antes de cerrar#4821
CNo registró el número de atención#4822
FAfirmó una exención de comisión que no existe#4823

Todo hallazgo cita el turno, y la cita se verifica

El juez tiene que señalar el fragmento literal que sostiene el problema. Axon comprueba si ese texto existe de verdad en la conversación de origen; una cita que no calza derriba la confianza de la evaluación.

Cita verificada en el turno 14

“…ese cobro ya fue cancelado, puede ignorar el recibo.”

La conclusión es humana, y la máquina se mide

Tus revisores evalúan parte de la muestra a ciegas. Publicamos la concordancia entre ellos y el juez (kappa de Cohen) junto con el resultado: si el juez no concuerda con tu equipo, se ve.

κ 0,74concordancia sustancial

62 conversaciones etiquetadas por 2 revisores · discrepancias listadas una por una en el dossier.

El diagnóstico

Una fotografía defendible de lo que hacen hoy tus agentes

Un trabajo con principio, medio y fin, no una suscripción. Al final tienes un dossier que sostiene una respuesta ante auditoría interna, defensoría del cliente o regulador.

4 frentes

Alcance

  • Rúbrica escrita con tu equipo

    Las dimensiones evaluadas salen de tu política interna de riesgo y cumplimiento, no de una plantilla nuestra.

  • Muestra estadística del periodo

    Estratificada por canal, agente y ventana de tiempo, con nivel de confianza y margen de error declarados.

  • Evaluación con tu clave de IA

    Cada conversación de la muestra pasa por el juez LLM corriendo con la clave (BYOK) del proveedor que ya homologaste.

  • Calibración a ciegas

    Tus revisores evalúan parte de la misma muestra sin ver al juez, y medimos la concordancia con kappa de Cohen.

4 semanas

Plazo

  • Alcance y rúbrica

    Sesiones con riesgo y cumplimiento para escribir las dimensiones.

  • Ingesta y muestreo

    Las transcripciones entran con PII redactada y se sortea la muestra.

  • Evaluación y calibración

    El juez corre con tu clave y tus revisores etiquetan a ciegas.

  • Dossier y presentación

    Entrega del documento y lectura conjunta de los hallazgos.

Lo que necesitamos de ti: las transcripciones del periodo y dos horas de un revisor para la calibración.

5 piezas

Entregable

  • Nota por dimensión con margen de error

    Un intervalo declarado en cada dimensión, no un número suelto.

  • Fragmento literal en cada hallazgo

    Cotejado con el turno de origen de la conversación evaluada.

  • Parámetros de la ejecución registrados

    Muestreo, versión del modelo juez y versión de la rúbrica, para que el resultado pueda reejecutarse.

  • Resultado de la calibración humano contra juez

    El kappa y las discrepancias listadas una por una.

  • Conclusión de cumplimiento firmada

    Por una persona de tu equipo. El modelo no decide eso.

Ver un dossier de ejemplo, completo

La plataforma

El dossier no termina en un PDF

Cada nota del diagnóstico queda navegable en la plataforma: tu equipo de riesgo entra, baja de la nota del agente hasta el turno que generó el hallazgo y lo comprueba solo, sin depender de nosotros.

Salud de los agentes

Atención · cobranza+1,2
Apertura de cuenta+0,4
Renegociación−2,8
Muestra de 384 conversacionesκ 0,74rúbrica v4
  • Panel de salud por agente

    Nota actual, tendencia de 7 y 30 días y qué agentes están empeorando, por canal.

  • Hallazgo ligado al turno

    Desde cualquier nota bajas hasta la conversación y ves el fragmento exacto que la generó, ya verificado.

  • Calibración y kappa

    Tus revisores etiquetan a ciegas en la propia pantalla, y la concordancia con el juez sale calculada.

  • Rúbrica versionada

    Todo cambio de dimensión o de peso genera versión, y cada evaluación señala la versión que la juzgó.

  • Ingesta idempotente

    Transcripciones por carga, API REST o SDK tipado. Reenviar el mismo lote no duplica nada.

  • PII redactada en la entrada

    Identificación fiscal, tarjeta, teléfono, correo y nombres salen antes de persistir y antes de que el juez vea el texto.

Preguntas frecuentes

Preguntas, respondidas.

¿Qué prueba exactamente Axon?

Que tus agentes de IA se comportan, o no, conforme a tu política interna, con evidencia. Para cada conversación evaluada hay nota por dimensión de la rúbrica y, en cada hallazgo, el fragmento literal de la conversación que lo sostiene. La observabilidad muestra latencia, costo y volumen; Axon evalúa el contenido de la atención.

¿Quién firma la conclusión de cumplimiento?

Una persona de tu equipo, siempre. El juez LLM produce nota y evidencia; la lectura de cumplimiento es humana y queda registrada como tal en el dossier, con el nombre de quien firmó. Ningún modelo decide si algo cumple.

¿Con qué clave de IA se hace la evaluación?

Con la tuya (BYOK). El juez corre con la clave Anthropic, OpenAI o compatible de tu institución, el proveedor que tu equipo ya homologó. Tus datos no pasan por una clave gestionada por Axon ni alimentan el entrenamiento de terceros, y el costo de inferencia queda visible para ti.

¿Cómo se tratan los datos de las conversaciones?

La PII (correos, identificación fiscal, tarjetas, teléfonos, nombres) se redacta antes de persistir nada y antes de que cualquier texto llegue al juez. El modelo solo ve texto ya redactado.

¿Cuánto tiempo se retienen los datos? (LGPD)

La ventana de retención la defines tú y se aplica automáticamente: las conversaciones más antiguas que el plazo se purgan. En cualquier momento la institución puede solicitar la eliminación de todos sus datos, conforme a la ley brasileña de protección de datos (LGPD).

¿Qué tenemos que entregar para empezar?

Las transcripciones del periodo (JSON, JSONL o CSV), por carga, por la API REST o por el SDK tipado, y dos horas de un revisor de tu equipo para la calibración. La ingesta es idempotente, así que reenviar el mismo lote no duplica nada.

¿Cómo sabemos que la nota del juez es confiable?

Tres mecanismos: toda cita se coteja con el turno de origen; la confianza de la evaluación refleja la concordancia entre muestras independientes del juez; y la concordancia con tus revisores humanos se mide con kappa de Cohen y se publica junto con el resultado. Si el juez discrepa de tu equipo, el dossier lo muestra.

Descubre lo que hacen tus agentes cuando nadie está mirando.

Una conversación de 30 minutos para definir el alcance. Si tiene sentido, el diagnóstico empieza la semana siguiente.

¿Ya eres cliente? Entrar