Instituições reguladas pelo BACEN

Conformidade e qualidade de agentes de IA em empresas reguladas

A Axon avalia as conversas reais dos seus agentes de IA contra a sua política interna e entrega um dossiê defensável: nota por dimensão com margem de erro, cada achado com o trecho literal que o sustenta e a conclusão assinada por gente.

Diagnóstico de 4 semanas · avaliação na sua própria chave de IA (BYOK) · PII redigida antes de qualquer processamento
B+
Atendimento · cobrança
Amostra de 384 conversas · margem de erro 5%
κ 0,74
Aderência à política
92
Dever de informar
88
Anti-alucinação
74
Evidência · turno 14

“O cliente pediu a 2ª via do boleto 3×, e o agente afirmou que a cobrança havia sido cancelada, o que não consta no sistema.”

O juiz roda na sua chave, no provedor que você já homologou
  • Anthropic
  • OpenAI
  • Google
  • Meta Llama
  • Mistral
  • DeepSeek
Como funciona

Auditável nos três pontos que o regulador pergunta

Contra o que foi avaliado, o que sustenta cada achado e quem assinou a conclusão.

  1. A rubrica é a sua políticaAs dimensões avaliadas saem da sua política interna, versionadas.
  2. Toda citação é conferidaO trecho literal é checado contra o turno de origem da conversa.
  3. A conclusão é humanaO kappa entre os seus revisores e o juiz sai junto do resultado.

A rubrica é a sua política

As dimensões avaliadas são escritas à mão com o seu time de risco, versionadas, e é contra elas que cada conversa recebe nota. Nada de critério genérico de fornecedor.

AInformou custo efetivo total antes de fechar#4821
CNão registrou o protocolo de atendimento#4822
FAfirmou isenção de tarifa que não existe#4823

Todo achado cita o turno, e a citação é conferida

O juiz precisa apontar o trecho literal que sustenta o problema. A Axon confere se aquele texto existe mesmo na conversa de origem; citação que não bate derruba a confiança da avaliação.

Citação verificada no turno 14

“…essa cobrança já foi cancelada, o senhor pode ignorar o boleto.”

A conclusão é humana, e a máquina é medida

Seus revisores avaliam parte da amostra às cegas. Publicamos a concordância entre eles e o juiz (kappa de Cohen) junto do resultado: se o juiz não concorda com o seu time, isso aparece.

κ 0,74concordância substancial

62 conversas rotuladas por 2 revisores · divergências listadas uma a uma no dossiê.

O diagnóstico

Uma fotografia defensável do que os seus agentes fazem hoje

Um trabalho com começo, meio e fim, não uma assinatura. Ao final você tem um dossiê que sustenta uma resposta a auditoria interna, ouvidoria ou regulador.

4 frentes

Escopo

  • Rubrica escrita com o seu time

    As dimensões avaliadas saem da sua política interna de risco e compliance, não de um template nosso.

  • Amostra estatística do período

    Estratificada por canal, agente e janela de tempo, com nível de confiança e margem de erro declarados.

  • Avaliação na sua chave de IA

    Cada conversa da amostra passa pelo juiz LLM rodando na chave (BYOK) do provedor que você já homologou.

  • Calibração às cegas

    Seus revisores avaliam parte da mesma amostra sem ver o juiz, e medimos a concordância por kappa de Cohen.

4 semanas

Prazo

  • Escopo e rubrica

    Sessões com risco e compliance para escrever as dimensões.

  • Ingestão e amostragem

    As transcrições entram com PII redigida e a amostra é sorteada.

  • Avaliação e calibração

    O juiz roda na sua chave e seus revisores rotulam às cegas.

  • Dossiê e apresentação

    Entrega do documento e leitura conjunta dos achados.

O que precisamos de você: as transcrições do período e duas horas de um revisor para a calibração.

5 peças

Entregável

  • Nota por dimensão com margem de erro

    Intervalo declarado em cada dimensão, não um número solto.

  • Trecho literal em cada achado

    Conferido contra o turno de origem da conversa avaliada.

  • Parâmetros da execução registrados

    Amostragem, versão do modelo juiz e versão da rubrica, para o resultado poder ser reexecutado.

  • Resultado da calibração humano contra juiz

    O kappa e as divergências listadas uma a uma.

  • Conclusão de conformidade assinada

    Por uma pessoa do seu time. O modelo não decide isso.

Ver um dossiê de exemplo, por inteiro

A plataforma

O dossiê não termina num PDF

Cada nota do diagnóstico fica navegável na plataforma: seu time de risco entra, desce da nota do agente até o turno que gerou o achado e confere sozinho, sem depender de nós.

Saúde dos agentes

Atendimento · cobrança+1,2
Abertura de conta+0,4
Renegociação−2,8
Amostra de 384 conversasκ 0,74rubrica v4
  • Painel de saúde por agente

    Nota atual, tendência de 7 e 30 dias e quais agentes estão piorando, por canal.

  • Achado ligado ao turno

    De qualquer nota você desce até a conversa e vê o trecho exato que a gerou, já conferido.

  • Calibração e kappa

    Seus revisores rotulam às cegas na própria tela, e a concordância com o juiz sai calculada.

  • Rubrica versionada

    Toda alteração de dimensão ou peso gera versão, e cada avaliação aponta a versão que a julgou.

  • Ingestão idempotente

    Transcrições por upload, API REST ou SDK tipado. Reenviar o mesmo lote não duplica nada.

  • PII redigida na entrada

    CPF, cartão, telefone, e-mail e nomes saem antes de persistir e antes de o juiz ver o texto.

FAQ

Perguntas, respondidas.

O que exatamente a Axon prova?

Que os seus agentes de IA se comportam, ou não, conforme a sua política interna, com evidência. Para cada conversa avaliada há nota por dimensão da rubrica e, em cada achado, o trecho literal da conversa que o sustenta. Observabilidade mostra latência, custo e volume; a Axon avalia o conteúdo do atendimento.

Quem assina a conclusão de conformidade?

Uma pessoa do seu time, sempre. O juiz LLM produz nota e evidência; a leitura de conformidade é humana e fica registrada como tal no dossiê, com o nome de quem assinou. Nenhum modelo decide se algo está conforme.

A avaliação usa qual chave de IA?

A sua (BYOK). O juiz roda na chave Anthropic, OpenAI ou compatível da sua instituição, o provedor que o seu time já homologou. Seus dados não passam por chave gerenciada pela Axon nem alimentam treinamento de terceiro, e o custo de inferência fica visível para você.

Como os dados de conversa são tratados?

PII (e-mails, CPF/CNPJ, cartões, telefones, nomes) é redigida antes de qualquer coisa ser persistida e antes de qualquer texto ir ao juiz. O modelo só vê texto já redigido.

Por quanto tempo os dados ficam retidos? (LGPD)

A janela de retenção é definida por você e aplicada automaticamente: conversas mais antigas que o prazo são purgadas. A qualquer momento a instituição pode solicitar a eliminação de todos os seus dados, conforme a LGPD.

O que precisamos entregar para começar?

As transcrições do período (JSON, JSONL ou CSV), por upload, pela API REST ou pelo SDK tipado, e duas horas de um revisor do seu time para a calibração. A ingestão é idempotente, então reenviar o mesmo lote não duplica nada.

Como sabemos que a nota do juiz é confiável?

Três mecanismos: toda citação é conferida contra o turno de origem; a confiança da avaliação reflete a concordância entre amostras independentes do juiz; e a concordância com os seus revisores humanos é medida por kappa de Cohen e publicada junto do resultado. Se o juiz discorda do seu time, o dossiê mostra.

Descubra o que os seus agentes fazem quando ninguém está olhando.

Uma conversa de 30 minutos para definir o escopo. Se fizer sentido, o diagnóstico começa na semana seguinte.

Já é cliente? Entrar