A rubrica é a sua política
As dimensões avaliadas são escritas à mão com o seu time de risco, versionadas, e é contra elas que cada conversa recebe nota. Nada de critério genérico de fornecedor.
A Axon avalia as conversas reais dos seus agentes de IA contra a sua política interna e entrega um dossiê defensável: nota por dimensão com margem de erro, cada achado com o trecho literal que o sustenta e a conclusão assinada por gente.
“O cliente pediu a 2ª via do boleto 3×, e o agente afirmou que a cobrança havia sido cancelada, o que não consta no sistema.”
Contra o que foi avaliado, o que sustenta cada achado e quem assinou a conclusão.
As dimensões avaliadas são escritas à mão com o seu time de risco, versionadas, e é contra elas que cada conversa recebe nota. Nada de critério genérico de fornecedor.
O juiz precisa apontar o trecho literal que sustenta o problema. A Axon confere se aquele texto existe mesmo na conversa de origem; citação que não bate derruba a confiança da avaliação.
“…essa cobrança já foi cancelada, o senhor pode ignorar o boleto.”
Seus revisores avaliam parte da amostra às cegas. Publicamos a concordância entre eles e o juiz (kappa de Cohen) junto do resultado: se o juiz não concorda com o seu time, isso aparece.
62 conversas rotuladas por 2 revisores · divergências listadas uma a uma no dossiê.
Um trabalho com começo, meio e fim, não uma assinatura. Ao final você tem um dossiê que sustenta uma resposta a auditoria interna, ouvidoria ou regulador.
As dimensões avaliadas saem da sua política interna de risco e compliance, não de um template nosso.
Estratificada por canal, agente e janela de tempo, com nível de confiança e margem de erro declarados.
Cada conversa da amostra passa pelo juiz LLM rodando na chave (BYOK) do provedor que você já homologou.
Seus revisores avaliam parte da mesma amostra sem ver o juiz, e medimos a concordância por kappa de Cohen.
Sessões com risco e compliance para escrever as dimensões.
As transcrições entram com PII redigida e a amostra é sorteada.
O juiz roda na sua chave e seus revisores rotulam às cegas.
Entrega do documento e leitura conjunta dos achados.
O que precisamos de você: as transcrições do período e duas horas de um revisor para a calibração.
Intervalo declarado em cada dimensão, não um número solto.
Conferido contra o turno de origem da conversa avaliada.
Amostragem, versão do modelo juiz e versão da rubrica, para o resultado poder ser reexecutado.
O kappa e as divergências listadas uma a uma.
Por uma pessoa do seu time. O modelo não decide isso.
Cada nota do diagnóstico fica navegável na plataforma: seu time de risco entra, desce da nota do agente até o turno que gerou o achado e confere sozinho, sem depender de nós.
Nota atual, tendência de 7 e 30 dias e quais agentes estão piorando, por canal.
De qualquer nota você desce até a conversa e vê o trecho exato que a gerou, já conferido.
Seus revisores rotulam às cegas na própria tela, e a concordância com o juiz sai calculada.
Toda alteração de dimensão ou peso gera versão, e cada avaliação aponta a versão que a julgou.
Transcrições por upload, API REST ou SDK tipado. Reenviar o mesmo lote não duplica nada.
CPF, cartão, telefone, e-mail e nomes saem antes de persistir e antes de o juiz ver o texto.
Que os seus agentes de IA se comportam, ou não, conforme a sua política interna, com evidência. Para cada conversa avaliada há nota por dimensão da rubrica e, em cada achado, o trecho literal da conversa que o sustenta. Observabilidade mostra latência, custo e volume; a Axon avalia o conteúdo do atendimento.
Uma pessoa do seu time, sempre. O juiz LLM produz nota e evidência; a leitura de conformidade é humana e fica registrada como tal no dossiê, com o nome de quem assinou. Nenhum modelo decide se algo está conforme.
A sua (BYOK). O juiz roda na chave Anthropic, OpenAI ou compatível da sua instituição, o provedor que o seu time já homologou. Seus dados não passam por chave gerenciada pela Axon nem alimentam treinamento de terceiro, e o custo de inferência fica visível para você.
PII (e-mails, CPF/CNPJ, cartões, telefones, nomes) é redigida antes de qualquer coisa ser persistida e antes de qualquer texto ir ao juiz. O modelo só vê texto já redigido.
A janela de retenção é definida por você e aplicada automaticamente: conversas mais antigas que o prazo são purgadas. A qualquer momento a instituição pode solicitar a eliminação de todos os seus dados, conforme a LGPD.
As transcrições do período (JSON, JSONL ou CSV), por upload, pela API REST ou pelo SDK tipado, e duas horas de um revisor do seu time para a calibração. A ingestão é idempotente, então reenviar o mesmo lote não duplica nada.
Três mecanismos: toda citação é conferida contra o turno de origem; a confiança da avaliação reflete a concordância entre amostras independentes do juiz; e a concordância com os seus revisores humanos é medida por kappa de Cohen e publicada junto do resultado. Se o juiz discorda do seu time, o dossiê mostra.
Uma conversa de 30 minutos para definir o escopo. Se fizer sentido, o diagnóstico começa na semana seguinte.
Já é cliente? Entrar