Acurácia de LLMs

📊 Em um projeto recente, tive a oportunidade de testar diversos LLMs para um case no setor de Marketing de uma empresa na área de Notícias e Geração de Conteúdo.

Irei explorar o case em mais detalhes futuramente, mas apenas para contextualizar, estávamos classificando cerca de 2.000 notícias criadas nos últimos 24 meses de acordo com um novo sistema de classificação de conteúdo proposto pela empresa.

Utilizamos o AWS Bedrock para esta tarefa, o que nos permitiu comparar diversos modelos em cima de um mesmo pipeline.

Para além da performance dos modelos, outras questões como revisão do sistema de classificação, comparação com concorrentes, custo e etc também foram levantadas e serão abordadas posteriormente.

Agora quero apenas trazer para vocês o desempenho de cada modelo em nosso teste, com a acurácia baseada em um dataset de treino já rotulado.

Para termos um benchmark, comparamos a performance do modelo com a de um time de especialistas da empresa que também realizou uma classificação do dataset de treino, sem saber a resposta correta.

pereira