Quando a IA inventa coisas: como se reconhece e como se evita

Um modelo não inventa por má-fé, inventa porque produz a continuação provável de um texto – e um estudo inventado é uma continuação muito provável. Isso não se evita por completo, mas delimita-se em larga medida.

Uma forma muito luminosa sem sombra e sem estrutura interior, atrás dela uma menor que projeta sombra real

O essencial

  • Os dados inventados não nascem nas perguntas difíceis, nascem nas que têm uma forma de resposta expectável – números, fontes, artigos de lei.
  • Cinco tipos são especialmente afetados: estudos, volumes de pesquisa, referências legais, detalhes de produtos e citações.
  • A medida mais eficaz é uma proibição de inventar no prompt, mais uma obrigação de assinalar o desconhecido.
  • Um tom seguro não é sinal de correção – os modelos formulam os dados inventados com a mesma desenvoltura que os comprovados.

O termo «alucinação» induz em erro, porque soa a um estado de exceção. Na verdade trata-se do mesmo procedimento que produz também as respostas certas: a continuação provável de um texto.

À pergunta por um estudo sobre um tema, a continuação provável é uma referência de estudo com instituto, ano e percentagem. Se esse estudo existe não é uma grandeza para a geração.

Cinco tipos de dados especialmente afetados

1. Estudos e estatísticas

«Segundo um estudo de 2024, 67 por cento das PME usam…» – o instituto, o ano e a percentagem atuam em conjunto de forma muito convincente, e os três podem ser livremente inventados.

Sinal: números redondos, sem ligação, instituto sem título exato.

2. Volumes de pesquisa e números de mercado

Nenhum modelo tem acesso aos dados de consulta de um motor de busca. Quando se pergunta, vêm à mesma números – porque a pergunta espera um número.

Sinal: qualquer número nesta área. Sem exceção.

3. Referências legais e prazos

Números de artigo, disposições, prazos transitórios. Especialmente perigosos, porque soam técnicos e desencadeiam decisões na prática.

Sinal: um número preciso sem indicação da versão e da data.

4. Detalhes de produtos e preços

Âmbito funcional, limites de plano, preços de fornecedores. Mudam com frequência e estão muitas vezes atrás de barreiras de sessão.

Sinal: valores exatos sem data e sem fonte.

5. Citações e dados sobre pessoas

Citações literais, designações de função, quem disse o quê e quando. Aqui o dano é maior, porque se atribui algo a pessoas reais.

Sinal: qualquer citação sem localização verificável.

Sabia que…?

O tom não revela nada. Os modelos formulam os dados inventados com a mesma firmeza dos comprovados – um «provavelmente» ou «possivelmente» não aparece onde a incerteza está de facto.

É essa a razão pela qual o método de verificação habitual falha: as pessoas avaliam a credibilidade também pela segurança da apresentação. Nos modelos, esse sinal não existe – é preciso verificar o dado em si, não a sua apresentação.

O que ajuda de facto

  1. Proibição de inventar no prompt. A instrução de não usar nenhum número nem fonte que não conste dos dados fornecidos – e de assinalar o desconhecido como [dado em falta]. A medida isolada mais eficaz.
  2. Fornecer material em vez de perguntar. Quem escreve os próprios números no prompt não precisa de inventados. A diferença entre «escreve algo sobre X» e «escreve algo sobre X, aqui estão os nossos números» é o maior salto de qualidade isolado.
  3. Modelos com pesquisa para o que é atual. Se o modelo puder procurar e nomear as fontes, os dados podem ser verificados. Mas poder verificar não significa: verificado.
  4. Verificação como passo próprio. Mandar gerar uma lista de todas as afirmações verificáveis e depois verificá-las. Separada da escrita, senão é saltada.
  5. Números com origem. Cada número do texto final recebe uma indicação de origem – mesmo que seja «valor de experiência, não um levantamento».
Atenção A pergunta «tens a certeza?» não é uma verificação. Um modelo pode confirmar um dado inventado na mesma conversa ou alterá-lo sob pressão – nenhuma das coisas diz nada sobre a correção. A verificação faz-se na fonte, não na conversa.
Da prática

O caso mais caro não é o dado obviamente errado, é o que fica por pouco ao lado: um prazo que existe, mas com outra data. Um artigo que existe, mas regula outra coisa. Um preço de fornecedor que estava certo há dois anos.

Esses dados sobrevivem a qualquer verificação superficial, porque se conseguem confirmar – só que noutra versão. Por isso não chega verificar se a fonte existe; é preciso verificar se ela diz o que está no texto.

A regra do prompt na sua formulação

Três frases que pertencem a qualquer prompt em que possam nascer dados verificáveis:

Bloco de prompt
Regras para os dados:
1. Não uses nenhum número, estudo, referência legal ou citação
   que não conste do material que te forneci acima.
2. Onde precisares de um dado que ali falte, escreve
   [dado em falta: qual] em vez de o completares.
3. Assinala no fim da frase, com [não verificado], todas as
   afirmações que não consigas comprovar a partir do material.

Estas três regras têm precedência sobre todas as outras
instruções deste prompt.

A última frase não é supérflua: as indicações no fim de um prompt são tidas em conta com mais fiabilidade, e uma precedência expressa impede que as regras sejam sacrificadas ao desejo de um texto fluido.

Verificar com uma segunda passagem

Prompt
Avalia o texto seguinte quanto a dados possivelmente inventados.
Sê rigoroso; não elogies nada; não reescrevas o texto.

Texto:
[colar texto]

Tarefas:
1. Lista isoladamente cada afirmação verificável: números,
   percentagens, estudos, referências legais, anos, dados de
   produtos, preços, citações.
2. Assinala em cada afirmação: comprovável a partir do próprio
   texto / tenho de verificar externamente / parece inventada.
   Em "parece inventada", indica o sinal.
3. Indica os três dados cuja falsidade causaria maior dano, e
   fundamenta.
4. Formula, para cada dado não comprovado, uma versão que
   dispense esse dado e continue a dizer alguma coisa.

Não inventes indicações de fonte nem provas. Se não conseguires
classificar um dado, escreve-o.

Conclusão

Os dados inventados não são um defeito da ferramenta, são uma propriedade do procedimento. Não desaparecem, mas delimitam-se: fornecer material em vez de perguntar, pôr a proibição de inventar no prompt, e fazer a verificação como passo próprio.

A consequência incómoda: todos os dados verificáveis de um texto publicado têm de ter sido verificados por uma pessoa. É a parte que não se automatiza – e a razão pela qual o conhecimento técnico se torna mais importante com o uso de modelos de linguagem, não menos.

Perguntas frequentes

Porque é que os modelos de linguagem inventam coisas?

Porque produzem a continuação provável de um texto. A uma pergunta por um estudo, a continuação provável é uma referência de estudo com instituto, ano e percentagem – se esse estudo existe não é uma grandeza para a geração. Trata-se do mesmo procedimento que produz também as respostas certas.

Que dados são especialmente afetados?

Cinco tipos: estudos e estatísticas, volumes de pesquisa e números de mercado, referências legais e prazos, detalhes de produtos e preços, e citações e dados sobre pessoas. Têm em comum o facto de a pergunta esperar uma forma de resposta determinada – um número, um artigo, uma citação.

Reconhecem-se os dados inventados pelo tom?

Não. Os modelos formulam os dados inventados com a mesma firmeza dos comprovados; as ressalvas como «provavelmente» não aparecem onde a incerteza está de facto. É preciso verificar o dado em si, não a sua apresentação.

Ajuda perguntar «tens a certeza?»

Não. Um modelo pode confirmar um dado inventado na mesma conversa ou alterá-lo sob pressão – nenhuma das coisas diz nada sobre a correção. A verificação faz-se na fonte, não na conversa.

O que ajuda de forma mais eficaz?

Fornecer material em vez de perguntar: quem escreve os próprios números no prompt não precisa de inventados. A isso junta-se uma proibição expressa de inventar com obrigação de assinalar o desconhecido – no fim do prompt, com precedência sobre todas as outras instruções – e uma verificação como passo próprio.

Marketing que se configura sozinho

A beta do Studio Engine está aberta. Reserve o seu lugar e participe desde o início.

Participar na beta →
← Voltar à lista