O uso de modelos de linguagem de grande porte (LLMs, na sigla em inglês), como os empregados em sistemas de inteligência artificial generativa, tem ampliado possibilidades em tarefas de texto.

No entanto, esse avanço também trouxe um desafio crescente: como manter a qualidade das respostas sem elevar custos financeiros, computacionais e ambientais? Para enfrentar esse problema, um grupo de pesquisadores ligados ao INCT TILDIAR desenvolveu um estudo voltado à orquestração inteligente de LLMs em cenários reais.
Principais objetivos
A pesquisa busca desenvolver e avaliar estratégias de roteamento de LLMs capazes de selecionar automaticamente o modelo mais adequado para cada solicitação. Para isso explora técnicas de Query Performance Prediction (QPP) e roteamento de modelos para prever a complexidade de cada solicitação antes de definir qual IA deve processá-la.
Em vez de utilizar sempre o mesmo sistema para todas as interações, a proposta direciona tarefas simples para modelos menos custosos e reserva modelos mais robustos para demandas complexas. Com isso, o que se pretende é reduzir custos computacionais: financeiros, ambientais e temporais. E, com esse cuidado, ser capaz também de manter desempenho semelhante ou superior ao de abordagens baseadas em um único modelo.
Também se investiga formas de equilibrar qualidade das respostas, tempo de processamento e consumo de recursos, aproximando o uso da inteligência artificial de princípios de responsabilidade e sustentabilidade.
Um dos problemas que motivam a pesquisa é o uso indiscriminado de modelos generalistas. Em muitos cenários, perguntas simples acabam consumindo mais recursos do que o necessário, enquanto tarefas complexas podem ser atendidas por sistemas insuficientes, comprometendo a qualidade dos resultados.
Quem participa
A pesquisa, intitulada “Orquestração de LLMs para Redução de Custos em Cenários Reais: Uma Perspectiva de IA Responsável e Sustentável aplicada a texto”, é conduzida pelo estudante de graduação João Carlos Normando Nogueira, bolsista de Iniciação Científica, sob orientação do professor Edleno Silva de Moura, da Universidade Federal do Amazonas (UFAM). Participam também os pesquisadores Marcos André Gonçalves (UFMG) e Washington Cunha (Unicamp).
Além de contribuir para a redução de gastos em aplicações reais, o estudo pode fortalecer práticas de IA responsável, especialmente em serviços baseados em texto que dependem de alta escalabilidade. A expectativa é que a orquestração dinâmica de modelos permita ampliar o acesso a tecnologias de linguagem, reduzindo desperdícios sem comprometer a qualidade das respostas.