Pular para o conteúdo
Bruno Fraga
AULÃO #059··16 minAtualizado em

Wayback Machine para Investigação Digital: Como Encontrar Provas e Conteúdo Apagado da Internet

Capítulos

9 seções
Neste artigo

O que você vai aprender neste aulão

A Wayback Machine para investigação digital é uma das ferramentas mais poderosas e mais subutilizadas que existem. Nesse aulão eu passei quase duas horas ao vivo mostrando como sair do básico do Archive.org (aquele de clicar em bolinha na linha do tempo) e usar o arquivo da internet como um investigador usa: extraindo, filtrando e correlacionando o histórico inteiro de um site.

Depois de ler, você vai saber recuperar conteúdo que sumiu da internet (um perfil apagado, um anúncio com preço que "nunca existiu", um site de phishing que saiu do ar), registrar essa evidência com data e hora para uso jurídico, e ir além da interface gráfica com a interface CDX em JSON. E vou mostrar como combinar tudo isso com ferramentas de linha de comando para mapear centenas de subdomínios e milhares de URLs de um alvo de uma vez.

Isso não é teoria de manual. É o fluxo que eu uso em casos reais de investigação de fraude e checagem, aplicado sobre dados públicos. Aqui eu demonstrei sobre portais de prefeituras justamente por serem dados abertos, sem nenhuma invasão. O objetivo é você entender a diferença entre "abrir o Archive e clicar" e "investigar de verdade".

O que é a Wayback Machine e por que ela guarda o que foi apagado

A Wayback Machine é o serviço do Internet Archive que arquiva a web desde 1996 e já guarda mais de 866 bilhões de páginas. É um projeto sem fins lucrativos, mantido por doações de empresas e pessoas, com a missão de ser a biblioteca da internet: sites, livros, vídeos, áudios, tudo salvo em capturas com data e hora.

Para investigação, o valor é direto. Um Twitter que virou privado, uma postagem apagada do Instagram, um site que saiu do ar, um anúncio com uma condição que o vendedor jura que nunca existiu. Se o Archive passou por ali e capturou, você consulta o cache. E cada captura vem com timestamp, o que a torna útil como registro de evidência.

Esse ponto interessa muito a quem trabalha com investigação e Direito. Se você é advogado, detetive, investigador ou policial e precisa provar que algo estava no ar, a Wayback Machine pode ser um clique com valor probatório, mais barato e mais rápido que uma ata notarial. Você registra que aquilo estava naquele domínio, naquele momento, naquele timestamp. É o registro de evidência que eu encaixo dentro da metodologia do aulão sobre o Protocolo Sherlock.

E o Archive não vive só de capturas automáticas. Você pode forçar o arquivamento de uma página agora mesmo, usando a opção "Save Page Now", e gerar na hora um endereço permanente daquele conteúdo. Isso é ouro quando você encontra uma evidência que pode sumir a qualquer momento: um anúncio de golpe, um perfil suspeito, uma publicação difamatória. Em vez de torcer para o Archive passar por ali, você mesmo congela o estado atual com data e hora.

Uma ressalva honesta: o registro reflete o que estava no ar no instante do arquivamento, não a realidade atual do site. Isso é a favor da investigação (congela o passado), mas exige que você leia a data de cada captura com atenção. E é justamente por isso que o timestamp é tão importante numa peça processual: ele diz não só que o conteúdo existiu, mas exatamente quando.

O que significam as cores das bolinhas na linha do tempo

Aquelas bolinhas coloridas do calendário do Archive têm significado, e quase ninguém sabe ler. Entender isso economiza tempo antes mesmo de você mudar para o modo avançado.

  • Azul: captura com sucesso. O Archive acessou a página e salvou o conteúdo que estava lá.
  • Verde: houve um redirecionamento. A URL apontou para outro endereço antes de o conteúdo ser capturado, então a captura veio de um redirect.
  • Amarelo: erro. O snapshot registrou uma resposta de erro do cliente ou do servidor, sem conteúdo útil e sem redirecionar.
  • Tamanho da bolinha: a quantidade de snapshots naquele dia. Um dia pode ter captura de manhã, meio-dia, tarde e noite, e quanto mais capturas, maior a bolinha.

Bateu o olho, já sabe o que aconteceu. E aqui vai um detalhe que muda a leitura de um caso: um dia com bolinha azul grande significa que o alvo estava ativo e mudando o conteúdo com frequência naquele período, o que ajuda a datar quando algo apareceu ou sumiu do site.

Mas eu vou ser sincero: eu não uso o Archive assim. Clicar bolinha por bolinha, esperar cada aba carregar, voltar, abrir outra, é lento demais para uma investigação séria. Serve para uma consulta pontual. Para trabalho de verdade, existe um caminho muito melhor.

Como usar o Archive.org de forma avançada com atalhos de URL

O jeito rápido de usar o Archive é montar a URL na mão em vez de preencher o formulário. Toda busca no Archive abre num padrão de endereço previsível, e você pode manipular esse endereço direto.

Quando você abre uma captura, a URL fica no formato web.archive.org/web/[ID-do-snapshot]/[site]. Se você trocar o ID por um asterisco, fica web.archive.org/web/*/[site] e cai direto na visão de todas as capturas daquele domínio, sem passar pela home do Archive. É um atalho que economiza cliques.

O pulo do gato vem com o asterisco no final da URL do site. Um endereço como [site]/* faz o Archive listar tudo que ele tem daquele domínio: milhares de URLs, com tipo de conteúdo, data e captura. E o melhor, essa listagem tem um campo de filtro. Você digita "login" e vê só as URLs de login arquivadas. Digita "txt" e vê os arquivos de texto que já estiveram no site. Digita um telefone, um nome, um CNPJ, e filtra em todo o histórico.

O Archive ainda tem uma busca avançada com operadores parecidos com Google Hacking: filtra por título, mídia, URL e exporta em JSON, HTML ou CSV. É quase um dork dentro do arquivo, o mesmo raciocínio que eu ensino no aulão sobre Google Hacking.

A interface CDX: baixando todo o histórico de um site em JSON

A interface CDX é o que transforma o Archive de site de consulta em fonte de dados para investigação. Ela não é bem uma API, é um endpoint que devolve, em vez de uma tela formatada, os dados brutos de todas as capturas de um domínio prontos para você processar.

A estrutura é web.archive.org/cdx/search/cdx?url=[site]. Ao abrir, o Archive retorna a lista completa de capturas que ele tem daquele domínio. Você pega isso e monta uma planilha, um CSV, uma base de dados. E dá para refinar com parâmetros:

  • collapse=urlkey junta as capturas por URL única e elimina duplicadas, ideal para mapear as páginas distintas de um site.
  • output=json entrega tudo em JSON, pronto para código.
  • Filtro de status deixa você pegar só as URLs que respondiam 200, descartando os erros.
  • Paginação e limite permitem quebrar um domínio gigante em pedaços tratáveis, sem travar o browser com milhões de linhas de uma vez.

Com isso você tem, em um clique, o dump completo do histórico de um site: URLs originais, colapsadas por chave, filtradas, em JSON. E aí vem o poder de verdade: filtrar palavras-chave (senha, nome, e-mail, token) em todas as URLs que aquele domínio já teve. É a diferença entre olhar uma página e fazer perguntas para o histórico inteiro do site.

No aulão eu até pedi ajuda de IA para montar um pequeno código em Python que lia o JSON e filtrava termos numa página HTML. Mas honestamente, você nem precisa programar: existe ferramenta pronta que faz isso e muito mais.

waybackurls e gau: automatizando a extração de URLs

O waybackurls automatiza exatamente o processo do CDX: você joga um domínio e ele traz todas as URLs que o Wayback Machine conhece. É uma ferramenta em Go do tomnomnom, e a irmã dela, o gau (getallurls), agrega URLs de várias fontes de arquivo.

A instalação é simples num ambiente Kali, que é o mesmo que eu uso e comparei no aulão sobre Kali e TraceLabs. Você precisa do Go instalado (sudo apt install golang) e roda go install no repositório do waybackurls. Depois, é só mandar um domínio pela ferramenta e salvar a saída num arquivo de texto.

No aulão, rodei sobre o meu próprio domínio e o waybackurls trouxe 1.621 URLs conhecidas. Filtrei por "login" e apareceram as páginas de login arquivadas. Filtrei por termos e vieram tokens, certificados, áreas de produto que já estiveram no ar. É o mesmo trabalho do CDX, mas em segundos e por linha de comando, pronto para encadear com outras ferramentas.

E Kali Linux já traz quase tudo que você precisa para esse fluxo: é só instalar o Go e rodar os go install. A vantagem da linha de comando sobre a interface gráfica não é só velocidade, é composição. Você encadeia a saída de uma ferramenta na entrada da outra com um pipe, filtra com grep, salva num arquivo e alimenta a etapa seguinte. Uma investigação que levaria uma tarde clicando no calendário vira um comando de uma linha que você reaproveita em cada caso novo.

Mapeando a superfície inteira de um alvo com subfinder e aquatone

O salto de escala acontece quando você combina o arquivo com descoberta de subdomínios. Um alvo não tem um domínio só: pode ter dezenas ou centenas de subdomínios, e cada um tem o próprio histórico no Archive. Investigar só o domínio principal é olhar uma fração do escopo.

O fluxo que eu montei ao vivo foi este:

  1. subfinder para descobrir os subdomínios do alvo de forma passiva. É a mesma lógica que eu detalho no aulão sobre encontrar subdomínios escondidos. Num portal público de prefeitura, saí de 1 domínio para 134 subdomínios.
  2. waybackurls sobre todos os subdomínios de uma vez, expandindo tudo que o Archive sabe de cada um. O resultado passou de 249 mil URLs, e eu ainda tinha cancelado no meio.
  3. httpx para sondar quais dessas URLs ainda respondem, separando o que está vivo do que é só cache.
  4. aquatone para acessar as páginas e gerar um relatório HTML com screenshot de cada uma e, o mais valioso, um grafo de correlações.

Deixei claro no aulão, e reforço aqui: fiz isso sobre dados abertos de prefeituras, sem nenhuma invasão. É reconhecimento passivo sobre informação pública, o tipo de mapeamento que a própria organização deveria fazer da própria superfície.

E Archive, subfinder e aquatone se completam justamente porque cada um cobre uma camada. O subfinder amplia o alvo de um para dezenas ou centenas de endereços. O waybackurls traz o passado de cada um deles. O httpx separa o que ainda vive do que é só memória. O aquatone junta tudo numa visão única. Sozinha, cada ferramenta é útil; encadeadas, elas viram um raio-X do histórico completo de um domínio e de tudo que orbita em volta dele.

Correlação de evidências: o grafo do aquatone na prática

O aquatone entrega o que uma investigação de escopo grande realmente precisa: correlações entre páginas que, olhadas uma a uma, você jamais fecharia. Ele pega a lista de URLs, acessa todas, tira print de cada uma e monta um grafo ligando o que elas compartilham.

O relatório mostra subdomínios que dividem o mesmo IP, o mesmo código de Google Tag Manager, o mesmo processador de pagamento, a mesma versão de tecnologia. E aqui está o uso investigativo mais forte: se você desconfia que domínios distintos pertencem ao mesmo dono (uma rede de fraude, por exemplo), você joga todos no aquatone e ele revela o que os une. Um ID que se repete, um IP compartilhado, um plugin na mesma versão, a mesma imagem. É a técnica de correlação que eu aprofundo no aulão sobre inteligência de mercado e no aulão sobre técnicas para investigar sites.

Esse é o ponto central da investigação digital de verdade. Um alvo pode ter 500 subdomínios e 250 mil páginas no histórico. Você não vai abrir uma por uma procurando um telefone. Você baixa todo o histórico, aplica uma expressão regular para achar telefones, e-mails ou CNPJs, e correlaciona. A percepção manual (abrir um site, caçar a foto, o telefone) continua valendo, mas não escala. O digital exige abstrair. Quando um site de phishing sai do ar, por exemplo, é assim que você recupera a evidência antes que ela desapareça, o que conversa direto com o aulão sobre investigar e-mails fraudulentos.

Mas correlação sem contexto vira ruído. O grafo do aquatone te entrega centenas de conexões, e nem toda conexão significa a mesma coisa. Um IP compartilhado pode ser só uma hospedagem em nuvem que milhares de sites usam. Um Google Tag Manager repetido pode ser de uma agência que atende dezenas de clientes. O trabalho do investigador é separar a coincidência da pista: quando o mesmo processador de pagamento, o mesmo ID de analytics e a mesma imagem aparecem juntos em domínios que se dizem independentes, aí você tem uma correlação forte de mesmo dono. Um sinal isolado quase nunca fecha um caso.

Como registrar uma evidência com valor probatório passo a passo

Registrar uma prova na Wayback Machine é mais sólido quando você segue uma ordem clara em vez de só tirar um print. Print de tela qualquer um contesta; um registro no Archive com endereço permanente é bem mais difícil de derrubar.

  1. Abra o web.archive.org e use "Save Page Now" na URL exata da evidência, não na home do site.
  2. Guarde o endereço permanente gerado, que já embute o timestamp do arquivamento.
  3. Anote em paralelo o domínio, a data, a hora e o que aquela página mostrava, para amarrar o registro ao seu relatório.
  4. Se a evidência tem várias páginas (um perfil com dezenas de posts, por exemplo), arquive cada URL relevante, não só a principal.

Esse cuidado transforma uma captura solta numa peça que se sustenta. E ele se encaixa na mesma disciplina de coleta e documentação que eu defendo como base de qualquer investigação séria, não como um passo opcional.

Erros comuns ao usar o Archive numa investigação

O erro mais comum é confundir "não está no ar" com "não existe". O conteúdo pode não estar mais no site original e continuar guardado no cache do Archive. Muita gente abre o domínio hoje, vê que a página sumiu e conclui que a pista morreu, quando na verdade ela está a um asterisco de distância na Wayback Machine.

O segundo erro é ficar preso na interface gráfica. Clicar bolinha por bolinha te dá uma visão de uma página; a CDX e o waybackurls te dão o histórico inteiro para filtrar. Mas eu vejo investigador experiente perder horas no calendário porque nunca aprendeu o modo de dados.

O terceiro erro é ignorar os subdomínios. O alvo raramente vive só no domínio principal, e o histórico mais revelador costuma estar num subdomínio esquecido, sem manutenção, que ninguém pensou em limpar. Rodar o subfinder antes do Archive é o que abre o escopo de verdade.

E Google indexa muita coisa, mas não guarda o passado como o Archive guarda. Essa é a confusão final que vale desfazer: buscar no Google mostra o que existe agora; buscar no Archive mostra o que existiu. As duas fontes se complementam, e a investigação forte usa as duas em conjunto, cruzando o presente indexado com o passado arquivado para reconstruir a linha do tempo de um alvo.

Ferramentas Utilizadas Neste Aulão

FerramentaFinalidadeLink
Wayback MachineRecuperar conteúdo apagado e registrar evidência com dataweb.archive.org
Archive Advanced SearchBusca com operadores e exportação em JSON/CSVarchive.org
waybackurlsExtrair todas as URLs de um domínio do Waybackgithub.com/tomnomnom
gau (getallurls)Agregar URLs de várias fontes de arquivogithub.com/lc/gau
subfinderDescobrir subdomínios de forma passivagithub.com/projectdiscovery
httpxSondar quais URLs estão ativasgithub.com/projectdiscovery
aquatoneRelatório visual com screenshots e correlaçõesgithub.com/michenriksen
Go (golang)Linguagem para instalar as ferramentasgo.dev

Perguntas Frequentes

Como recuperar uma página que foi apagada da internet?

Insira a URL na Wayback Machine e veja as capturas arquivadas na linha do tempo. Se o Archive passou pela página antes de ela sumir, o conteúdo continua acessível no cache, com data e hora do arquivamento.

A Wayback Machine serve como prova jurídica?

Sim, é usada como registro de evidência porque cada captura tem timestamp e mostra o que estava no ar naquele instante. É mais rápida e barata que uma ata notarial, mas lembre que ela reflete o momento do arquivamento, não a realidade atual do site.

Como buscar uma palavra em todo o histórico de um site?

Use a interface CDX (web.archive.org/cdx/search/cdx?url=site) para baixar todas as capturas em JSON, ou o waybackurls para extrair todas as URLs por linha de comando. Depois filtre o termo (nome, e-mail, telefone) na lista inteira.

O que é a interface CDX do Archive?

É um endpoint que devolve, em vez de uma tela gráfica, os dados brutos de todas as capturas de um domínio, com parâmetros para colapsar por URL, filtrar status e exportar em JSON. É o que permite tratar o Archive como fonte de dados.

Preciso saber programar para usar essas técnicas?

Não. As ferramentas prontas (waybackurls, subfinder, httpx, aquatone) fazem o trabalho por linha de comando. Saber um pouco de filtro de texto ajuda, mas você chega longe só encadeando as ferramentas.

Elas trabalham sobre informação pública e arquivada, sem invadir nada. No aulão eu demonstrei sobre dados abertos de prefeituras. O uso responsável é para investigação legítima, preservação de prova e mapeamento da própria superfície.

Qual a diferença entre o waybackurls e o gau?

O waybackurls busca URLs especificamente no Wayback Machine. O gau (getallurls) agrega URLs de várias fontes de arquivo além do Wayback, trazendo um resultado mais amplo. Os dois rodam em Go e servem ao mesmo objetivo.

Veja também: Favicon para Investigação Digital: Busca Reversa por Hash no Shodan — Aulão #062

Referências e Recursos

Conteudo Relacionado