E se, em vez de reunir 20 especialistas durante semanas ou meses, um pesquisador pudesse criar 20 especialistas artificiais em minutos? Um representaria um engenheiro com décadas de experiência; outro, um regulador; um terceiro, um pesquisador acadêmico; outro, alguém responsável pela operação cotidiana de determinada tecnologia. Todos participariam anonimamente de sucessivas rodadas, receberiam os resultados do grupo, reconsiderariam suas posições e, no fim, poderiam chegar a um consenso.
Essa é a ideia por trás do método Delphi com IA. Ela parece, ao mesmo tempo, extraordinariamente eficiente e metodologicamente desconfortável. O problema está em uma palavra: especialista.
Uma inteligência artificial pode desempenhar o papel de um especialista. Mas isso significa que ela é um especialista para fins de produção de evidência científica?
Publicidade
A distinção pode determinar se estamos diante de uma nova modalidade legítima de pesquisa ou apenas de uma sofisticada simulação.
O método Delphi com IA já deixou de ser hipótese
O Delphi foi desenvolvido justamente para situações em que a evidência disponível é incompleta e o julgamento especializado pode ajudar a organizar incertezas. Em sua forma clássica, especialistas respondem individualmente a uma questão, recebem informações agregadas sobre as respostas do grupo e participam de novas rodadas, nas quais podem rever suas posições.
Anonimato, iteração, feedback controlado e agregação das respostas estão entre suas características fundamentais. Guias metodológicos recentes também ressaltam a necessidade de critérios claros para composição do painel, definição prévia do consenso e regras para encerrar as rodadas.
A chegada dos grandes modelos de linguagem torna tecnicamente possível reproduzir praticamente toda essa arquitetura.
Em setembro de 2026, um artigo disponibilizado online pela revista Futures apresentou exatamente essa possibilidade. O trabalho utilizou dez grandes modelos de linguagem como “especialistas sintéticos”, atribuindo a eles personas profissionais diferentes e organizando suas respostas em três rodadas de um Delphi voltado ao futuro das telecomunicações entre 2026 e 2050. Os autores encontraram convergência entre os modelos e apresentaram a abordagem como uma forma escalável de ampliar exercícios de prospecção tecnológica.
Portanto, a primeira pergunta já tem resposta. É possível executar algo estruturalmente semelhante a um Delphi usando somente inteligências artificiais. A pergunta cientificamente mais difícil vem depois: o que esse consenso significa?
Várias IAs não são necessariamente vários especialistas
Imagine dez especialistas humanos. Eles passaram por universidades diferentes, trabalharam em organizações distintas, erraram, aprenderam, acompanharam projetos que fracassaram, conheceram regulações locais, enfrentaram restrições orçamentárias e desenvolveram interpretações próprias sobre seu campo profissional.
Agora imagine dez agentes de IA aos quais sejam atribuídas essas mesmas biografias por meio de prompts. As descrições podem ser diferentes. A fonte do conhecimento, porém, pode continuar amplamente compartilhada.
Mesmo modelos produzidos por empresas distintas foram treinados com enormes conjuntos de textos parcialmente sobrepostos e refletem muito do conhecimento já registrado publicamente. Quando diversas personas são criadas dentro de um mesmo modelo, o risco de confundir diversidade narrativa com diversidade epistemológica é ainda maior.
Um prompt pode dizer a um modelo: “você é um engenheiro brasileiro com 25 anos de experiência em infraestrutura”. Isso produz uma personagem coerente. Não produz 25 anos de experiência. Essa diferença não torna a resposta inútil. Apenas muda aquilo que ela representa.
O paradoxo do consenso fácil demais
Há outro problema: talvez uma inteligência artificial seja boa demais em concordar.
Um estudo publicado em 2026 sobre o uso de LLMs como especialistas sintéticos em avaliação de pavimentos produziu 1.080 respostas artificiais e as comparou com as de profissionais humanos e estudantes de engenharia. Os modelos apresentaram elevada consistência interna e boa capacidade de seguir personas e contextos.
Mas um resultado é particularmente revelador.
Dentro dos grupos sintéticos, as respostas apresentaram correlações muito altas entre si. Entre os especialistas humanos, a concordância agregada também podia ser elevada, mas as avaliações individuais eram consideravelmente mais diversas. No estudo, a correlação média entre pares de especialistas humanos foi de apenas 0,28, enquanto os agentes artificiais exibiram padrões muito mais homogêneos.
Isso modifica a interpretação de um Delphi. Convergência normalmente é tratada como resultado do processo: especialistas inicialmente diferentes observam os argumentos do grupo, reconsideram suas posições e eventualmente se aproximam.
Mas se os participantes artificiais já partem de representações semelhantes do conhecimento, a convergência pode não demonstrar deliberação. Pode apenas revelar uma origem comum.
O perigo é produzir um consenso extremamente limpo, estatisticamente convincente — e epistemologicamente pobre.
A IA também comprime a diversidade humana
O problema não aparece apenas em estudos com especialistas. Uma avaliação publicada na PNAS em 2026 comparou dados sociais gerados por 15 modelos de linguagem com informações reais de grandes pesquisas. Os modelos conseguiram reproduzir alguns padrões, mas tenderam a transformar populações heterogêneas em perfis excessivamente típicos. Relações entre variáveis também apareceram mais fortes nos dados sintéticos do que nos dados humanos.
Outro estudo, publicado na Nature, mostrou que modelos de linguagem conseguiram prever com desempenho relevante os resultados de dezenas de experimentos das ciências sociais. Ao mesmo tempo, os efeitos estimados pelos modelos foram sistematicamente maiores do que os observados nos experimentos reais.
Os dois resultados ajudam a entender o dilema. Uma IA pode capturar muito bem aquilo que é típico, documentado e recorrente sem necessariamente reproduzir toda a variabilidade que existe entre pessoas reais.
Em um Delphi, essa variabilidade não é apenas ruído. Muitas vezes ela é justamente o material intelectual do método.
Então um Delphi exclusivamente artificial seria cientificamente válido?
Depende da afirmação científica que o pesquisador pretende fazer. Se o estudo concluir que “especialistas humanos chegaram a esse consenso”, utilizar apenas IAs evidentemente não sustenta a afirmação.
Se concluir que “um conjunto de grandes modelos de linguagem, configurados para representar diferentes perspectivas profissionais, convergiu para essas respostas sob determinado protocolo”, a afirmação pode ser perfeitamente investigável.
A diferença parece pequena, mas é fundamental. Um painel exclusivamente artificial poderia ser metodologicamente legítimo como simulação de Delphi, experimento computacional, instrumento exploratório ou método de prospecção baseado no conhecimento incorporado aos modelos.
O que ainda exige evidência é sua equivalência a um painel humano. Por isso, chamar qualquer exercício desse tipo simplesmente de “Delphi” pode esconder uma transformação importante no objeto de pesquisa. Expressões como Delphi sintético, Delphi baseado em LLMs ou simulação Delphi com especialistas sintéticos tornam mais explícito aquilo que realmente foi feito.
Três usos diferentes exigem três níveis de cautela
Uma maneira de organizar essa fronteira seria distinguir três situações. Na primeira, a IA apenas auxilia um Delphi humano. Pode ajudar a revisar literatura, formular itens preliminares, resumir comentários anônimos, detectar redundâncias ou organizar o feedback entre rodadas. Os especialistas continuam sendo pessoas. Aqui, a inteligência artificial funciona essencialmente como ferramenta.
Na segunda, surge um Delphi híbrido. Especialistas humanos e agentes artificiais participam do processo, mas suas respostas podem ser identificadas e comparadas separadamente. Essa configuração permitiria investigar onde humanos e modelos convergem, onde discordam e quais argumentos aparecem exclusivamente em cada grupo.
A terceira situação é a mais radical: nenhum integrante do painel é humano. É justamente nela que a pergunta sobre validade deixa de ser operacional e passa a ser epistemológica.
O experimento mais interessante talvez seja comparar os três mundos
Em vez de tentar demonstrar imediatamente que a IA pode substituir especialistas, uma pesquisa particularmente informativa poderia executar três painéis paralelos sobre o mesmo problema. Um seria formado apenas por especialistas humanos. Outro utilizaria especialistas sintéticos. O terceiro combinaria ambos.
Perguntas, escalas, número de rodadas, regras de consenso e feedback seriam mantidos tão semelhantes quanto possível. Os pesquisadores poderiam então comparar não apenas se os painéis chegaram à mesma conclusão, mas também a dispersão inicial das opiniões, as mudanças entre rodadas, os argumentos apresentados, os itens rejeitados, a estabilidade do consenso e a sensibilidade dos resultados à escolha do modelo e dos prompts.
Modelos de fornecedores diferentes poderiam ser utilizados para reduzir a dependência de uma única arquitetura. Cada configuração poderia ser repetida várias vezes para verificar se o “especialista” mantém seu julgamento ou muda substancialmente quando o processo é executado novamente.
Também seria indispensável registrar versão do modelo, data de acesso, prompts completos, parâmetros de geração, personas, respostas integrais e critérios de consenso.
Nesse desenho, a pergunta deixaria de ser “a IA consegue fazer um Delphi?” — porque tecnicamente já sabemos que consegue.
A questão passaria a ser muito mais relevante: que tipo de conhecimento um Delphi artificial produz?
Talvez a IA revele algo sobre os próprios especialistas
Há ainda uma consequência menos óbvia. Comparar painéis humanos e artificiais pode transformar a IA não apenas em ferramenta metodológica, mas em instrumento para estudar a própria expertise.
Se humanos discordarem fortemente enquanto os modelos convergem, essa diferença poderá indicar que a experiência profissional contém elementos pouco registrados nos textos utilizados para treinar os modelos.
Se a IA identificar rapidamente o mesmo consenso obtido pelos humanos, talvez parte daquela “expertise” corresponda principalmente à síntese de conhecimento já amplamente documentado.
E se os modelos apresentarem argumentos que alterem posteriormente as respostas dos especialistas humanos, surgirá outra possibilidade: inteligência artificial e conhecimento humano funcionando como fontes distintas de informação dentro do mesmo processo deliberativo.
Nenhuma dessas hipóteses pode ser presumida antecipadamente. Todas podem ser testadas. É justamente aí que o tema se torna cientificamente interessante.
O potencial do método Delphi com IA talvez não esteja em descobrir como dispensar especialistas humanos. Pode estar em algo mais profundo: criar um experimento capaz de separar conhecimento registrado, julgamento profissional, experiência tácita e consenso social — componentes que o Delphi tradicional reúne sob uma única palavra, “especialista”.
Quando uma máquina consegue desempenhar convincentemente esse papel, somos obrigados a perguntar o que, afinal, tornava aquele papel especializado.
E essa talvez seja a provocação mais importante.

