Dados públicos como fonte para LLMs: o que muda no produto

Bruno ParodiProdutos DigitaisLeave a Comment

Imagem de capa do artigo “Dados públicos como fonte para LLMs: o que muda no produto”, com o título em destaque sobre fundo escuro e barras abstratas.
Compartilhe:

O estudo do Pew Research Center acompanhou a navegação real de adultos nos EUA, em março de 2025, e observou clique em algum resultado em 8% das visitas com resumo de IA, contra 15% nas sem. É uma associação observada, não prova de que o resumo cause a diferença. Só 1% clicou num link dentro do próprio resumo, e 26% encerraram a sessão logo após a página com resumo, contra 16% nas demais. É um dado de um país e de um buscador, mas deixa uma pergunta para quem constrói sites: se a resposta aparece antes do clique, para quem se fazem as páginas?

Este texto parte dessa pergunta e fica no terreno dos dados públicos como fonte para LLMs. A ideia nasce da experiência recente de construir projetos como o Planoscópio e o GanhaQuanto, que transformam bases públicas em páginas, análises e conhecimento estruturado, e da hipótese de que produtos assim possam ter um valor novo, além do tráfego de busca: virar uma fonte confiável e fácil de entender para LLMs. O limite precisa vir junto. As fontes levantadas aqui não trazem medição de citação do Planoscópio ou do GanhaQuanto por LLMs, nem estudo que meça isso para sites que ficam entre a base oficial e o leitor. O que segue é direção, não resultado.

O que a evidência sugere sobre fontes oficiais

No mesmo estudo do Pew, sites .gov aparecem em 6% dos resumos de IA, contra 2% dos resultados padrão. Wikipedia, YouTube e Reddit, juntos, respondem por cerca de 15% das fontes. Uma análise da Conductor, empresa que vende serviços de SEO e GEO e tem interesse comercial no assunto, vai na mesma direção: cada assistente tem suas preferências. O ChatGPT Search se ancora na Wikipedia; o Claude evita Wikipedia, YouTube e Reddit e cita fontes institucionais, mas num recorte de apenas dois meses. Cada estudo mede uma coisa diferente: o Pew mediu a frequência de sites .gov, Wikipedia, YouTube e Reddit entre as fontes dos resumos de IA do Google; a Conductor descreveu, por assistente, as preferências de fontes citadas, sem tratar fontes governamentais como categoria. Nenhum dos dois mediu sites que reorganizam dados oficiais.

O próprio Google também usa dado público. O Data Commons reúne mais de 250 bilhões de pontos de dados de fontes como ONU, OMS e institutos de censo, e o DataGemma o usa para ancorar modelos em estatísticas e reduzir alucinações. Isso mostra que dado público estruturado tem valor de ancoragem para um LLM, mas o caso demonstrado é o do Google, e a ancoragem se dá pela integração do próprio Data Commons, não por páginas de terceiros. Isso não se estende além desse caso: nada nas fontes levantadas mostra caminho equivalente para outros modelos ou assistentes.

No Google, não há truque técnico para aparecer nos resumos de IA

A documentação do Google diz que, para aparecer nos resumos de IA e no AI Mode, não é preciso criar arquivos para máquinas, nem marcação especial, nem um schema específico. Basta a página estar indexada e poder aparecer com trecho na Busca. Isso vale para o Google. Não há, nas fontes levantadas, dado equivalente para ChatGPT, Perplexity ou Claude, e a conclusão não deve ser estendida a eles.

Dentro desse limite, o atalho some e sobra o conteúdo. Se é assim, e se fonte oficial tem peso, o diferencial de um site de dados públicos tende a estar no que ele entrega além da base bruta: dado tratado, entidades bem definidas, comparações que a planilha original não faz, atualização em dia. É uma inferência, não um achado.

O que muda na decisão de produto

A pergunta ganha um segundo termo. Além de quais páginas podem ranquear no Google, passa a fazer sentido perguntar que base de conhecimento proprietária se está montando, de um jeito que buscador e LLM consigam entender, usar e, quem sabe, citar. Isso não significa abandonar SEO nem decretar que LLMs são a nova audiência. É acrescentar uma dimensão ao produto: uma base estruturada, atualizada e compreensível por máquinas e por pessoas.

Na prática, isso começa antes da página. Entra na escolha das bases, na arquitetura das páginas e na forma de organizar entidades, explicações, comparações e atualizações. A página deixa de ser o objetivo e vira uma das formas de expor a base.

Ser citado não garante visita

O retorno é a parte frágil. A Wikipedia é, segundo a própria Wikimedia, a base com que a maioria dos LLMs treina e cuja informação as plataformas de busca priorizam. Mesmo assim, a fundação relatou queda de cerca de 8% nos pageviews humanos em maio e junho de 2025, em comparação com 2024, depois de reclassificar tráfego de bots, vindo principalmente do Brasil. Ela atribui a queda às respostas diretas de IA nos buscadores e a jovens que preferem vídeo social; é a leitura da instituição.

Junto com o Pew, o que se pode dizer é que ser citado, sozinho, não garante visita. As fontes levantadas também não indicam de onde o retorno viria. Convém lembrar ainda que os dados são predominantemente dos EUA e, em boa parte, sobre o Google.

O que ainda não se sabe

Não há, nas fontes levantadas, medição de que sites derivados de dados públicos brasileiros sejam citados por LLMs ao agregar e explicar bases oficiais. Também faltam dados sobre licenciamento, APIs e atualização como fatores de citação. Por ora, é uma hipótese plausível de produto, sem teste.

Resta uma pergunta de medição: como um produto desses saberia que está sendo lido por quem não clica?


Compartilhe:

Leave a Reply

Your email address will not be published. Required fields are marked *

This site uses Akismet to reduce spam. Learn how your comment data is processed.