Realizado via Teams, o INCT TILDIAR inaugurou seu encontro mensal com os pesquisadores do Instituto. A estreia do evento teve como convidada a professora Aline Paes, da Universidade Federal Fluminense (UFF). Ela apresentou estudos sobre validação e auditoria de modelos de linguagem de grande porte (LLMs) no contexto do português do Brasil. Cerca de 40 participantes acompanharam a atividade ao vivo, fazendo perguntas e interagindo com a palestrante ao longo do encontro.

Durante a apresentação, intitulada “A Fauna Brasileira de LLMs e a Importância dos Benchmarks na Era da IA Generativa”, a pesquisadora chamou a atenção para um dos desafios centrais da Inteligência Artificial atualmente: como avaliar, com rigor científico, a qualidade de textos produzidos por modelos generativos.
O trabalho inicial foi desenvolvido em coautoria com Gabriel Assis, doutorando em Computação da UFF, e com a pesquisadora Cláudia Freitas. O resultado foi uma metodologia em camadas que combina métricas computacionais, IA como avaliadora e revisão humana especializada, mantendo uma etapa final de validação humana, descrita pela pesquisadora como um “humano como desembargador”.
“Investigamos quais Pequenos Modelos de Linguagem existiam para português, como fazer avaliação generativa, já que a maioria dos indicadores costuma focar em tarefas discriminativas, e quais benchmarks poderiam nos ajudar a medir esse desempenho no contexto brasileiro”, explicou.
Pequenos Modelos de Linguagem (ou SLM, da sigla em inglês) são versões compactas de IA projetadas para operar localmente em dispositivos móveis ou computadores e voltadas para executar tarefas específicas com a máxima eficiência possível.
Como avaliar respostas produzidas por IA?
O estudo “Exploring Brazil’s LLM Fauna: Investigating the Generative Performance of Large Language Models in Portuguese” foi publicado na edição especial da Journal of the Brazilian Computer Society (JBCS) dedicada a LLMs para português e pode ser consultado online.
O grupo avaliou modelos pequenos em três tipos de tarefas: sumarização, simplificação textual e sistemas de perguntas e respostas.
Para comparar os resultados, eles criaram um sistema de ranqueamento baseado em métricas já usadas na literatura científica, observando tanto aspectos lexicais quanto semânticos dos textos gerados. O objetivo foi entender como medir a qualidade das respostas produzidas por modelos conversacionais, um desafio ainda aberto na área.
Aline destacou a importância dos benchmarks, conjuntos de tarefas usados para comparar o desempenho de modelos de IA.

Segundo ela, bons benchmarks precisam reunir características como nível adequado de dificuldade, diversidade de problemas, utilidade prática, reprodutibilidade e mecanismos para evitar a chamada “contaminação dos dados” — quando conteúdos usados na avaliação acabam incorporados ao treinamento dos próprios modelos.
“É muito importante que existam iniciativas diversas criando benchmarks e um inventário amplo, com problemas realmente difíceis, para entendermos como as LLMs em português estão se saindo”, afirmou.
Os desafios da IA em português no Brasil
Além da discussão técnica, a pesquisadora chamou atenção para questões estratégicas no desenvolvimento de Inteligência Artificial no país, como sustentabilidade computacional, impacto de carbono e a necessidade de criar modelos capazes de compreender nuances culturais e linguísticas do português brasileiro e não apenas reproduzir traduções do inglês.
“Há várias pessoas no INCT preocupadas com sustentabilidade, modelos pequenos e formas mais eficientes de executar tarefas com LLMs. Também existe um esforço importante para criar recursos linguísticos e mantê-los atualizados”, disse.
Para Aline, um dos maiores desafios atuais é acompanhar a velocidade das transformações provocadas pela IA.
“Tenho certeza de que o INCT TILDIAR vai contribuir muito para aprofundar essas perguntas e avaliar esses desafios no contexto do nosso país e também como comunidade de pesquisadores em PLN e Inteligência Artificial”, concluiu.
Vídeo do encontro
A primeira edição do Café com IA foi gravada e está disponível no YouTube. A gravação também marca a estreia do canal @INCTTILDIAR, com o objetivo de ampliar o acesso às discussões realizadas.