Uma IA pode acertar cinco exemplos apresentados na reunião e falhar quando encontra o trabalho real. Avaliar significa transformar expectativas em casos testáveis antes de liberar a automação para clientes ou dados importantes.
Reúna exemplos reais
Separe tarefas comuns, casos difíceis e situações que devem ser recusadas. Remova dados pessoais quando necessário, mas preserve a variedade: textos curtos, erros de digitação, informações conflitantes e solicitações incompletas.
Defina o que será medido
- correção e completude;
- uso adequado das fontes;
- tom e formato;
- tempo e custo por tarefa;
- taxa de recusa correta;
- necessidade de revisão humana.
Crie uma resposta esperada
Nem todo caso tem uma única frase certa. Use critérios: fatos obrigatórios, afirmações proibidas e condições que exigem encaminhamento. Avaliadores diferentes devem chegar a conclusões parecidas.
Teste mudanças com o mesmo conjunto
Alterar modelo, prompt ou documentos pode melhorar um caso e piorar outro. Execute novamente os exemplos e compare. Acrescente ao conjunto todo erro relevante encontrado em produção.
Separe teste de desenvolvimento
Se a equipe ajusta o sistema olhando sempre para as mesmas perguntas, ele pode parecer melhor apenas porque se adaptou ao teste. Mantenha uma parte reservada para validação final.
Inclua segurança
Tente provocar vazamento de dados, instruções proibidas e ações além da permissão. Para agentes, teste o que acontece quando uma página ou documento contém comandos maliciosos.
Uma avaliação não promete perfeição. Ela mostra onde o sistema é confiável, onde precisa de supervisão e se uma nova versão realmente trouxe benefício.
Fonte: OpenAI — Evals




0 comentários
Participe da conversa. Todos os comentários passam por moderação.