A Nova Era do Google Hacking: Automatizar Buscas com IA
Capítulos
12 seçõesNeste artigo
- O que você vai aprender neste aulão
- O que é Google Hacking e por que a IA muda o jogo
- Como a IA automatiza o Google Hacking
- Ferramentas de Google Hacking com IA que eu uso
- Três frameworks de prompt para investigação com IA
- Deep Search do ChatGPT e Perplexity AI na prática
- Agentes de IA para investigação: o caso do Manus AI
- Como se proteger do Google Hacking automatizado
- Perguntas Frequentes
- Referências e Recursos
O que você vai aprender neste aulão
Neste aulão eu mostro o que é google hacking com IA na prática: como a inteligência artificial passou a montar operadores de busca, abrir a quinta página de resultado, ler dezenas de PDFs e cruzar fontes no lugar do investigador. É a evolução direta do que ensinei no Aulão #008 — 7 Buscas Perigosas que Revelam Informações Sensíveis no Google, só que agora com ChatGPT, Perplexity e agentes autônomos fazendo o trabalho braçal.
Antes de tudo, o enquadramento honesto. Tudo aqui é investigação em fonte aberta (OSINT) sobre dado público — nada de invadir sistema, nada de burlar login. Serve para quem apura com autorização (advogado, perito, analista de inteligência, empresário fazendo due diligence) e serve, acima de tudo, para você enxergar o que a sua própria pegada digital entrega. Porque se a IA acha em segundos, o problema de exposição já era seu ontem.
Eu vou te mostrar as ferramentas que eu uso, três frameworks de prompt que mudam o resultado, e uma seção inteira dedicada à defesa. A pergunta que abriu a aula foi provocativa: será que a IA matou o Google Hacking? A resposta curta é não — ela deu esteroide pra ele. O que antes dependia da sua memória de operador e da sua paciência para abrir página por página agora vira uma instrução em português. Vamos ao detalhe, do fundamento manual até o agente que investiga sozinho.
O que é Google Hacking e por que a IA muda o jogo
Google Hacking é a técnica de usar operadores de busca avançada (as chamadas dorks) para filtrar e refinar o que o Google indexou, chegando em documento, planilha e página que ninguém expôs de propósito, mas que ficaram públicos. Não é mágica: é sintaxe.
Os operadores que mais uso são poucos e fáceis de entender:
site:restringe a busca a um domínio, tiposite:gov.brfiletype:filtra por extensão, comofiletype:pdfoufiletype:xlsintitle:procura a expressão no título da páginainurl:procura o termo dentro do endereço"aspas duplas"força a ocorrência exata, ótimo para nome, CPF, CNPJ e username
Deixa eu ilustrar o refinamento do jeito que fiz na tela. Pesquisar relatório de investigação puro devolve notícia, post e menção misturados, um mar sem forma. Refino para relatório de investigação do governo e já filtro boa parte do ruído. Fecho com relatório de investigação do governo brasileiro e o resultado encolhe de novo. Só então implemento o Google Hacking de fato: site:gov.br filetype:pdf "relatório de investigação". De milhares de links soltos eu cheguei a PDFs oficiais com a expressão exata dentro do documento. Esse é o pulo do gato do operador — ele não busca mais coisa, ele elimina o que não interessa.
Combinando eles, uma busca genérica vira cirúrgica. site:gov.br filetype:pdf "relatório de investigação" sai de milhares de resultados soltos para um punhado de PDFs oficiais. E Google Hacking sempre dependeu disso: da sua memória, da sua criatividade para lembrar operador e imaginar a combinação certa. A lógica das dorks continua a mesma. Mas quem monta a combinação deixou de ser só você.
É exatamente aí que a IA entra. Um detalhe incômodo do lado defensivo: esses mesmos operadores que uso para investigar apontam para o que a sua empresa deixou exposto. Se um currículo com CPF e RG, uma planilha de e-mails ou um relatório interno em PDF está indexado, a dork acha. (No Aulão #009 — O Guia Definitivo para Investigar Vazamentos de Senhas na Internet eu mostro o outro lado dessa moeda, o dado que sai de banco de dados vazado.)
Como a IA automatiza o Google Hacking
Vamos ser sinceros: mesmo fazendo Google Hacking manual, ninguém vai até a segunda página. Muito menos a quinta, a décima. A IA vai. Ela abre todos os resultados, lê cada um, pensa em combinações de dork que você não lembraria e conecta os pontos entre aba e aba — o sócio, o e-mail, o CNPJ, o documento.
Tem uma coisa que a mão não faz e a IA faz sem suar: conectar tudo o que está aberto. Na aula eu tinha dezenas de abas abertas ao mesmo tempo — sócio numa, CNPJ noutra, processo numa terceira. Ligar esses pontos manualmente leva horas de leitura cruzada. A IA lê todas as abas, percebe que o e-mail da empresa aparece num vazamento, que o sócio responde a processo, que o domínio já trocou de dono, e devolve isso amarrado. É pivotagem automática, o coração de qualquer investigação de fonte aberta.
A virada é a linguagem natural. Em vez de decorar sintaxe, você descreve o que precisa e deixa o modelo montar as dorks e pesquisar por você. Mas nada disso funciona sem um bom prompt. A IA é um gênio literal: ela executa exatamente o que você pediu, com o contexto que você deu — e, se o prompt for ruim, ela até inventa ou distorce o resultado. Dá pra confiar cegamente? Não dá. Por isso prompt importa mais do que nunca.
Compare os dois. "O que está acontecendo na política brasileira?" é um prompt fraco: sem tempo, sem fonte, sem objetivo. Já "analise as notícias dos principais veículos brasileiros nas últimas 48 horas e identifique as três maiores polêmicas políticas, destacando declarações oficiais e reações nas redes" tem especificidade temporal, fonte definida e resultado prático. Mesma ferramenta, mundos diferentes.
Esse salto do buscador para o assistente investigativo é uma linha que já venho puxando faz tempo. E ChatGPT como aliado de investigação foi tema do Aulão #006 — ChatGPT: O Novo Aliado dos Investigadores Digitais; a ideia de montar seu próprio motor de busca vertical apareceu no Aulão #055 — Google Programmable Search Engine: Como Criar Seu Próprio Google para OSINT.
Ferramentas de Google Hacking com IA que eu uso
No primeiro nível, antes de agente e busca profunda, já existem ferramentas que criam a dork por você. No aulão eu demonstrei estas ao vivo:
| Ferramenta | Para que serve | Onde entra na investigação |
|---|---|---|
| DorkGPT | Monta operadores de busca a partir de linguagem natural | Criar a dork sem decorar sintaxe |
| Search Whisperer | Refina a pergunta e sugere buscas melhores | Estruturar a query antes de pesquisar |
| ChatGPT Deep Research | Busca profunda que lê fontes e compila relatório | Investigar empresa ou pessoa em fonte pública |
| Perplexity AI | Busca em tempo real com citação de fontes | Cruzar mídia e registros públicos |
| Manus AI | Agente com computador e browser próprios | Automatizar a investigação de um site inteiro |
| Operadores do Google | Referência oficial de busca avançada | Entender o que cada dork faz |
| Have I Been Pwned | Consulta e-mails em vazamentos conhecidos | Checar a sua própria exposição |
Vale destacar como cada uma se encaixa. DorkGPT é gratuito e direto: você descreve "planilha com e-mail em sites brasileiros" e ele devolve algo como site:br filetype:xls email. E DorkGPT resolve bem quando a pergunta é específica — abre demais o escopo e ele perde a mão. Search Whisperer trabalha um passo antes: ele reorganiza a sua pergunta, sugere caminhos e só então monta a dork mais completa (às vezes o projeto cai, então nem sempre está no ar).
Depois vêm os pesos-pesados da busca profunda. E ChatGPT, com o Deep Search ligado, varre a internet inteira a partir do seu prompt e compila um relatório. E Perplexity puxa as fontes em tempo real, com citação, o que ajuda a auditar de onde veio cada afirmação. No topo está o Manus AI, um agente com computador próprio — falo dele mais à frente. Para o lado da defesa, o Have I Been Pwned entra para você checar se o seu e-mail já apareceu em vazamento conhecido.
Três frameworks de prompt para investigação com IA
Prompt bom não é sorte, é estrutura. No aulão eu ensinei três formatos que uso para conduzir a investigação:
- Cascata (efeito cascata): você não joga um prompt gigante. Vai em camadas — primeiro "identifique os cinco maiores financiadores privados de campanha", depois "desses, quais respondem a processo por corrupção", depois "analise o impacto disso". Cada resposta alimenta a próxima pergunta e aprofunda a apuração.
- Condicional (decision tree): você embute uma bifurcação no prompt. "Se encontrar conexão entre a empresa e figuras políticas investigadas, liste os casos e os valores documentados; se não encontrar, indique as possíveis razões da ausência." A IA trata os dois cenários sem você reformular nada.
- Multifonte: você manda a IA comparar fontes distintas. "Compare a cobertura de mídias nacionais e internacionais sobre o escândalo X, destaque divergências e possíveis motivos" ou "cruze registro empresarial e judicial dos últimos três anos para revelar sócio oculto e alteração contratual frequente".
Para você ver que não é teoria: rodei o prompt em cascata na Perplexity pedindo os cinco maiores financiadores privados de campanha. Ela voltou com nomes, valores, padrão de doação e até uma conclusão amarrando tudo, com imagem agregada. Aí eu conduzo o próximo nível — "desses, quais respondem a processo por corrupção" — sem reescrever o contexto, porque ela já sabe de quem estamos falando. É investigação guiada, passo a passo, e não um único tiro no escuro.
Repare no fio condutor: fonte, critério temporal e resultado acionável. Sempre. É o que separa uma resposta genérica de uma prova utilizável.
Deep Search do ChatGPT e Perplexity AI na prática
Aqui a coisa fica concreta. Eu fiz esse teste ao vivo no aulão: peguei o CNPJ de uma transportadora qualquer e pedi um deep search com histórico legal, sócios, processos judiciais e notícias dos últimos dois anos — sempre confirmando que a busca era só em fonte pública. O ChatGPT perguntou se eu queria restringir a fontes públicas disponíveis, e eu confirmei.
O que voltou impressiona e assusta na mesma medida. A IA leu Serasa, quadro societário, portais de transparência, base de reclamação e repositório jurídico. O relatório trouxe: situação cadastral "inapta", oito processos com a empresa como parte (sete em São Paulo, um na Bahia), 86% em polo passivo, perfil "não recomendado" em site de reclamação, e-mail e telefone do site, redes sociais e possíveis pivôs para ex-sócios e empresas ligadas. Tudo em poucos minutos, o que a mão levaria um dia inteiro lendo.
Perplexity fez o mesmo caminho com um diferencial: busca mais em tempo real e mostra cada fonte enquanto lê. Para due diligence e apuração empresarial autorizada, isso é ouro — e é a mesma lógica de inteligência de mercado que detalhei no Aulão #046 — Inteligência de Mercado com OSINT: Vantagem Desleal Ética para Empresários. Vale a pena? Depende do prompt e da fonte. Com contexto ruim, a ferramenta enche linguiça; com contexto certo, ela entrega o dossiê.
O mais louco é ver a IA trabalhando ao vivo. Ela mostra a linha do tempo: "estou consultando o CNPJ", "encontrei no Jus Brasil", "estou lendo o quadro societário". Rodei o mesmo prompt no Deep Search e na Perplexity só para comparar, e os dois seguiram trilhas parecidas — Serasa, base de reclamação, repositório de processos. Peguei até uma empresa com situação irregular por acaso, o que mostra o tipo de sinal que salta rápido quando a leitura é automatizada. E o texto que a máquina compila ainda esconde muito dado por trás: arquivo bruto que você pode abrir e usar para continuar a apuração.
Um alerta que repito sempre: investigar pessoa exige responsabilidade e base legal. "Me traga tudo sobre o fulano" não é investigação, é abuso. O foco é dado público, finalidade legítima e cuidado com a LGPD.
Agentes de IA para investigação: o caso do Manus AI
O último nível não é buscar — é delegar a operação inteira. Um agente de OSINT é a IA com um papel fixo ("você é um analista de fonte aberta; ao receber um alvo, consulte mídia, redes e bases públicas e devolva um relatório contextualizado") que você reutiliza a cada caso.
O Manus AI vai além do agente comum: ele monta um computador próprio (um Ubuntu), sabe programar, usa editor e browser de verdade. No aulão eu passei um prompt gigante — "você investiga sites: abra o alvo, colete WHOIS, IP, SSL, pixels e identificadores de anúncio, identifique CNPJ e redes sociais, cruze os dados e gere relatório" — e soltei um site sugerido pela audiência. E Manus AI leva isso ao extremo: ele criou a máquina, abriu o browser, acessou as páginas, rodou script em Python, montou um to-do e entregou um relatório com dados de domínio, provedor, certificado, tecnologias (WordPress, GTM, pixels), pessoas envolvidas e cruzamento de consistência.
Enquanto o relatório do CNPJ ainda rodava, eu já tinha aberto o Manus para investigar um site. Essa é a diferença de escala: você não espera uma tarefa terminar para começar a próxima. O Manus criou um arquivo de texto para guardar os achados, montou um plano de execução visível e foi preenchendo item por item. Quando terminou, o relatório do site trouxe data de criação do domínio, registrador, servidores, faixa de IP, validade do certificado, a stack de tecnologia e a pessoa responsável, um dentista com décadas de experiência. E ainda sobrou dado bruto para eu perguntar mais e cavar mais fundo.
O detalhe que economiza dias: dá para rodar isso em dezenas de sites em paralelo, em várias instâncias ao mesmo tempo. A investigação de site em profundidade eu já tinha destrinchado no Aulão #036 — 8 Técnicas para Investigar Sites que Ninguém Te Ensina, e a leitura da anatomia de um link, que o agente faz sozinho agora, está no Aulão #063 — Como Investigar uma URL. O agente não substitui o método. Ele executa o método mais rápido.
Como se proteger do Google Hacking automatizado
Aqui está a parte que interessa a todo mundo, não só a investigador. Se a IA lê a quinta página e abre todo PDF indexado, o que a sua organização deixou vazar ficou muito mais fácil de achar. Reconhecer o ataque é o primeiro passo da defesa. Veja o que dá pra fazer:
- Faça o exercício contra você mesmo: rode as dorks básicas (
site:suaempresa.com.br filetype:pdf,filetype:xls email) no seu próprio domínio e veja o que aparece. - Tire de indexação o que não deveria estar público: use
robots.txte a meta tagnoindexem páginas sensíveis, e peça a remoção de URL no Search Console quando já vazou. - Nunca jogue CPF, RG, senha ou planilha interna em pasta pública de nuvem — foi assim que o
filetype:xls emaile ointext:senhaencontraram material real na aula. - Trate credencial como perecível: monitore seu e-mail corporativo em bases de vazamento e force troca de senha e MFA quando aparecer algo.
- Reduza a superfície: metadado de documento, subdomínio esquecido e diretório aberto (
index of) são os primeiros alvos de qualquer agente.
Uma camada que quase ninguém liga é o monitoramento contínuo. Não adianta limpar hoje e esquecer amanhã, porque conteúdo velho volta a ser indexado e funcionário novo publica planilha errada. Configure alerta para o nome da empresa e para domínios parecidos, revise a cada trimestre o que o Google mostra do seu CNPJ e trate cada achado como um incidente pequeno antes que vire grande. A mesma IA que investiga do lado de fora pode trabalhar do seu lado, varrendo a sua exposição de forma programada.
Nenhuma dessas medidas é infalível. Mas juntas elas cortam o retorno fácil. A IA amplia o alcance de quem procura; a sua defesa é diminuir o que existe para ser encontrado. Se você quer entrar de vez nessa área, com ferramentas e tendências de IA, o caminho eu tracei no Aulão #022 — O Melhor Momento para Começar na Investigação Digital: Ferramentas, IA e Tendências.
Perguntas Frequentes
O que é google hacking com IA?
É usar modelos de linguagem (como ChatGPT e Perplexity) para montar operadores de busca, executar as dorks e ler os resultados no seu lugar. Em vez de decorar sintaxe, você descreve o objetivo em linguagem natural e a IA faz a busca profunda e compila a resposta.
A IA acabou com o Google Hacking manual?
Não. A lógica das dorks continua idêntica e ainda é o que a IA usa por baixo dos panos. O que mudou é a escala: a máquina abre resultado que ninguém abre e cruza fontes em minutos. Saber a técnica manual segue sendo o que te deixa no controle do prompt.
Deep Search do ChatGPT e Perplexity AI são a mesma coisa?
São parecidos no propósito (busca profunda em muitas fontes), mas diferentes no estilo. O Deep Search costuma ir mais fundo no relatório final; a Perplexity puxa mais em tempo real e mostra a fonte de cada trecho enquanto pesquisa. Eu uso os dois em paralelo para comparar.
Preciso pagar para usar essas ferramentas?
Nem sempre. DorkGPT é gratuito, a Perplexity tem versão grátis e o Manus AI dá créditos iniciais. As versões pagas do ChatGPT e da Perplexity liberam buscas mais longas e completas, o que faz diferença em investigação séria.
Isso é legal? Posso investigar qualquer pessoa?
A técnica é legítima quando trabalha com dado público e finalidade legal — due diligence, apuração autorizada, defesa da própria empresa. Sair coletando tudo sobre uma pessoa sem base legal esbarra na LGPD e vira abuso. Método e responsabilidade andam juntos.
Como sei se meus documentos aparecem nessas buscas?
Rode as dorks no seu próprio domínio (site:seudominio filetype:pdf) e monitore seu e-mail em bases de vazamento. Se algo sensível aparecer, tire de indexação, peça remoção e troque a credencial. É o mesmo raciocínio de defesa, só que apontado para dentro.
Referências e Recursos
- Aulão #008 — 7 Buscas Perigosas que Revelam Informações Sensíveis no Google
- Operadores de busca avançada do Google (documentação oficial)
- Google hacking — verbete da Wikipedia
- Open-source intelligence (OSINT) — verbete da Wikipedia
- ChatGPT Deep Research — visão geral
- Manus AI — site oficial
- Have I Been Pwned — consulta de vazamentos
Conteudo Relacionado

Como Transformar Resultados do Google em Inteligência Automática

Desafio de Investigação Digital ao Vivo: Como Rastreamos um Golpista do Pix em 1h45

Como Encontrar Subdomínios Escondidos: Do DNSDumpster ao Brute Force
