Avaliar um agente exige testar o sistema completo: modelo, instruções, contexto, ferramentas, permissões e tratamento de falhas. O template organiza evidências antes de ampliar autonomia.

Identificação

Registre nome, versão, proprietário, objetivo, usuários, ambientes, modelo, instruções, ferramentas, fontes de dados e data. Qualquer mudança relevante deve produzir uma nova rodada de avaliação.

Casos de teste

Inclua identificador, tipo de caso, entrada, resultado esperado, ferramenta esperada, ações proibidas, necessidade de aprovação e gravidade da falha. Mantenha casos normais, ambíguos, incompletos, adversariais e de indisponibilidade.

Métricas

  • tarefa concluída corretamente;
  • ferramenta e parâmetros corretos;
  • evidência ou citação válida;
  • respeito a permissão e aprovação;
  • número de passos e repetições;
  • custo e latência;
  • escalonamento correto;
  • recuperação de erro.

Decisão

Defina limites antes de executar. Classifique cada falha por impacto e registre correção, responsável e reteste. A decisão final pode ser: bloquear, manter em experimento, lançar em modo de sugestão, lançar com aprovação ou permitir execução delimitada.

O arquivo para download contém colunas estáveis e uma linha marcada como exemplo. Adapte os limites ao risco do caso e conecte a decisão ao guia de governança de IA.

[ MATERIAIS PRÁTICOS ]

Use estes materiais

[ CONTINUE NO TEMA ]

Agentes de IA

Entenda, construa, avalie e opere agentes de IA com objetivos e limites claros.

GUIA PRINCIPALAgentes de IA: o que são, como funcionam e quando usarEntenda o que são agentes de IA, como usam ferramentas, memória e avaliações, e quando fazem sentido em produtos e operações.GUIA RELACIONADOComo criar agentes de IA: do objetivo à operaçãoCrie agentes de IA com um método prático para objetivo, ferramentas, contexto, segurança, avaliações, lançamento e monitoramento.GUIA RELACIONADOAgentes de IA com n8n: arquitetura e checklist de produçãoMonte agentes de IA com n8n usando gatilho, modelo, ferramentas, memória opcional, aprovação humana, avaliações e tratamento de erros.GUIA RELACIONADOExemplos de agentes de IA: casos, métricas e riscosVeja exemplos de agentes de IA em produto, suporte, operações e engenharia, com ferramentas, resultados, métricas e riscos.GUIA RELACIONADOAvaliação de agentes de IA: casos, métricas e gate de lançamentoAprenda a avaliar agentes de IA por resultado, trajetória, ferramentas, segurança, custo e prontidão antes de liberar uma mudança.GUIA RELACIONADOComo operar agentes de IA em produção: observabilidade, SLOs e incidentesAprenda a operar agentes de IA com observabilidade, SLOs proporcionais, controle de custos, resposta a incidentes e mudanças reversíveis.GUIA RELACIONADOPesquisa: quais controles a documentação oficial recomenda para operar agentes de IAAuditoria reproduzível de sete documentos oficiais sobre observabilidade, avaliação, métricas, controle humano e incidentes em agentes de IA.GUIA RELACIONADOResposta a incidentes de agentes de IA: contenção, recuperação e rollbackAprenda a detectar, conter, recuperar e aprender com incidentes de agentes de IA sem confundir rollback de configuração com reversão de efeitos externos.GUIA RELACIONADOPesquisa: quais controles oficiais aparecem na recuperação de agentes de IA?Auditoria reproduzível de oito documentos oficiais sobre detecção, contenção, retomada, fallback e aprovação na recuperação de agentes de IA.

Fontes primárias