Internet Archive vs Common Crawl vs web archive

O que o Internet Archive e o Common Crawl armazenam, o custo de uma consulta e quando a coleta ao vivo da Bright Data é a melhor opção.
26 min de leitura
Internet Archive vs Common Crawl vs Web archive

Consultamos o índice CC-MAIN-2026-30 do Common Crawl para theguardian.com e obtivemos 185 registros. Nenhum é um artigo. Cada registro é o próprio robots.txt do site ou um redirecionamento para ele, e esse arquivo proíbe o CCBot. A verificação de permissão é a única coisa que o crawl manteve.

A Wayback Machine do Internet Archive e o Common Crawl guardam cópias de páginas que não existem mais, e respondem a perguntas diferentes. A Wayback Machine reproduz uma URL específica como ela estava em uma data que você escolhe. O Common Crawl entrega bilhões de páginas como texto em massa, sem reprodução. Um web archive é a categoria à qual ambos pertencem, não um terceiro produto. A mesma categoria inclui arquivos nacionais da web, serviços por assinatura como o Archive-It, sites de captura sob demanda como o archive.today e arquivos WARC que você mesmo cria. Os dois serviços respondem perguntas sobre o passado; nenhum coleta um conjunto nomeado de sites de forma contínua.

TL;DR

  • O CCBot não executa JavaScript. Uma página renderizada pelo cliente chega como esqueleto.
  • Consulte o Common Crawl primeiro para trabalhos em massa e o Wayback para as ausências; inverta para uma lista de URLs conhecida.
  • Um digest CDX é o SHA-1 do payload, então use collapse=digest e collapse=timestamp para comparar no índice antes de buscar. O Common Crawl ignora collapse.
  • Projete um cliente Wayback CDX a 24 solicitações por minuto, 80% do pool compartilhado de 30/min.
  • Nenhum publica garantia de cobertura ou SLA, e nenhum serviço coleta um conjunto nomeado de sites continuamente. Meça seus domínios primeiro.

O que o Internet Archive e o Common Crawl armazenam

Uma captura do Wayback é endereçável como web.archive.org/web/<timestamp>/<url>, e a mesma URL pode ter milhares de capturas ao longo de três décadas. A reprodução padrão reescreve links e injeta uma barra de ferramentas para que a página seja renderizada no navegador.

Cada crawl mensal do Common Crawl é um conjunto de arquivos WARC mais arquivos de texto e metadados derivados, publicados em um bucket público. Um índice indica em qual intervalo de bytes de qual arquivo está uma determinada URL.

Wayback Machine Common Crawl
Armazena capturas de URLs individuais ao longo do tempo crawls mensais completos, WARC mais texto derivado
Responde uma URL em muitas datas muitas URLs de uma data de crawl
Reprodução sim, com links reescritos e barra de ferramentas injetada nenhuma
Busca em texto completo nenhuma nenhuma, mas os arquivos WET entregam o texto para indexar
Exportação em massa nenhuma, acesso via API o crawl completo, gratuito em bucket público
Limite de taxa 30 solicitações por minuto, CDX e timemap compartilhados, não publicado pelo Internet Archive nenhum publicado, “fortemente limitado por taxa”
Garantia de cobertura nenhuma nenhuma, e amostrado por ranking de domínio

CC-MAIN-2026-30 é anunciado com 2,14 bilhões de páginas e 364 TiB de conteúdo descomprimido em 40,5 milhões de hosts, rastreados em 18 dias. O Common Crawl coloca o corpus total em mais de 300 bilhões de páginas e descreve a taxa como 3 a 5 bilhões de novas páginas por mês, embora os últimos 18 crawls publicados tenham ficado abaixo de 3 bilhões. Dimensione um trabalho a partir de um único crawl.

O FAQ do Common Crawl diz: “Atualmente, o JavaScript não é executado e Cookies não são usados”. O CCBot armazena a resposta HTTP bruta, portanto uma página renderizada pelo cliente chega como seu esqueleto. Se as páginas que você precisa constroem seu conteúdo no navegador, verifique uma captura antes de planejar com base no Common Crawl.

Cada crawl vem com cinco conjuntos paralelos de 100.000 arquivos cada. O WARC carrega a resposta completa, o WAT carrega metadados e links extraídos, o WET carrega apenas texto simples, e dois outros carregam as capturas de robots.txt e as respostas não-200. Um trabalho de grafo de links lendo WARC move muito mais bytes do que o necessário.

O Common Crawl não promete revisitar nenhuma página, portanto muitas URLs em muitas datas é uma pergunta que nenhum dos serviços responde.

Matriz dois por dois. Eixo vertical de uma data a muitas datas, horizontal de uma URL a muitas URLs. A Wayback Machine ocupa uma URL em muitas datas; o Common Crawl muitas URLs de uma data de crawl; uma URL em uma data é trivial para ambos. O quadrante restante, muitas URLs em muitas datas, não é preenchido por nenhum.

O FAQ do Common Crawl declara a política de amostragem: o conjunto de dados “é uma amostra da web, e geralmente não arquivamos nenhum site inteiro, mas um subconjunto selecionado aleatoriamente”. O mecanismo está documentado em uma palestra de engenharia do Common Crawl e não no FAQ: rankings de centralidade harmônica no nível de domínio definem um orçamento de quantas URLs cada domínio recebe, então domínios bem linkados recebem um orçamento maior e domínios com baixo ranking podem não receber nenhum.

A Wayback Machine não tem busca em texto completo do conteúdo de páginas arquivadas. Sua própria página de ajuda diz que o Internet Archive espera “implementar um mecanismo de busca em texto completo em algum momento no futuro”. A busca do site corresponde a metadados do site, não ao texto dentro das páginas arquivadas. O Common Crawl fornece o texto, mas sem reprodução, então uma página reconstruída a partir de um arquivo WET não parecerá com o original.

O que uma consulta de domínio retorna

Executamos a mesma consulta em cinco domínios, com correspondência de prefixo.

Domínio consultado Registros no índice Registros de robots.txt Páginas de conteúdo
nytimes.com/* 1 1 0
cnn.com/* 1 1 0
bbc.com/* 2 2 0
theguardian.com/* 185 185 0
github.blog/* 4.700 49 4.651

Os 185 registros do Guardian se resolvem em apenas duas URLs, o robots.txt e seu redirecionamento http, rebuscados durante o crawl. Um script que conta registros do índice consideraria todos os cinco cobertos e estaria errado em quatro. Dos 4.651 registros de conteúdo do github.blog, 3.647 responderam 200.

O tipo de correspondência muda a resposta. A canonicalização SURT dobra www. no host simples, mas uma correspondência de prefixo domain/* não alcança nenhum outro subdomínio: cnn.com/* retornou 1 registro enquanto *.cnn.com retornou 11, e nytimes.com/* retornou 1 contra 2 para *.nytimes.com. Cada registro era uma busca de robots.txt em qualquer formato, mas as contagens são uma propriedade da consulta tanto quanto do crawl. Informe seu tipo de correspondência sempre que reportar um número como esse.

A mesma consulta data o bloqueio aproximadamente se você a executar em IDs de crawl mais antigos. A consulta tem um ponto cego: ela vê o que um publicador escreveu no robots.txt, não um bloqueio aplicado na borda da rede ou um opt-out posterior, então ela deve ser lida como um piso, não uma contagem. Nosso guia de robots.txt para scraping aborda como os grupos de agentes se resolvem.

O tamanho por crawl também tem caído. As estatísticas de tamanho de crawl publicadas pelo Common Crawl mostram a contagem mensal de páginas caindo de 3,031 bilhões em CC-MAIN-2025-05 para 2,149 bilhões em CC-MAIN-2026-30, uma queda de 29,1%. Nos 29 crawls de CC-MAIN-2024-10 a CC-MAIN-2026-30, os 10 crawls de 2024 têm média de 2,69 bilhões de páginas, os 12 crawls de 2025 têm média de 2,53 bilhões, e os 7 crawls publicados em 2026 até julho têm média de 2,15 bilhões.

Gráfico de linha das páginas do Common Crawl por crawl caindo de 3,1 para cerca de 2,1 bilhões, com médias anuais tracejadas em 2,69B para 2024, 2,53B para 2025 e 2,15B para os sete crawls de 2026 até julho.

Nada aqui identifica uma causa: o tamanho do crawl varia com infraestrutura, orçamento e agendamento dentro do Common Crawl tanto quanto com o que os publicadores fazem. A queda significa que um corpus dimensionado a partir de um crawl de 2024 superestima um de 2026 em cerca de um quarto, e que as contagens por crawl não se somam. Crawls consecutivos rebuscam grande parte da mesma fronteira, então somá-los sem deduplicar em urlkey e digest infla a estimativa novamente.

Verifique seus próprios domínios

O script conta registros de conteúdo contra buscas de robots.txt para o crawl publicado mais recente, usando a mesma correspondência de prefixo domain/* da tabela. Ele percorre o índice uma página por vez, rejeita uma página cuja truncagem divide um registro em vez de contar parte de um, e continua quando um domínio nunca responde de forma limpa. Os dois domínios abaixo levam cerca de 70 segundos, quase todo esse tempo em pausas deliberadas:

import http.client, json, time, urllib.error, urllib.parse, urllib.request

DOMAINS = ["theguardian.com", "github.blog"]
# Use your own contact address. One shared UA string arriving from many callers
# is the string an operator blocks.
UA = {"User-Agent": "coverage-check/1.0 ([email protected])"}

def latest_crawl():
    """Common Crawl ships roughly monthly. Hardcoding an ID measures a stale crawl
    and returns a number that looks current."""
    url = "https://index.commoncrawl.org/collinfo.json"
    info = urllib.request.urlopen(urllib.request.Request(url, headers=UA), timeout=60).read()
    return json.loads(info)[0]["id"]        # newest first

CRAWL = latest_crawl()
INDEX = f"https://index.commoncrawl.org/{CRAWL}-index"
print(f"crawl: {CRAWL}")

def fetch(params, tries=3):
    url = f"{INDEX}?{urllib.parse.urlencode(params)}"
    for attempt in range(tries):
        wait = None
        try:
            return urllib.request.urlopen(
                urllib.request.Request(url, headers=UA), timeout=120).read()
        except urllib.error.HTTPError as e:
            if e.code == 404:
                return None               # this crawl never captured the domain
            if e.code not in (429, 500, 502, 503, 504):
                raise
            wait = e.headers.get("Retry-After")   # the server's own number beats ours
        except (urllib.error.URLError, http.client.IncompleteRead, TimeoutError):
            pass                          # dropped connection
        time.sleep(int(wait) if wait and wait.isdigit() else 5 * 2 ** attempt)
    return b""

def coverage(domain):
    """(robots, content) for one domain, or None if the index never answered cleanly."""
    query = {"url": f"{domain}/*", "output": "json", "pageSize": 1}
    head = fetch({**query, "showNumPages": "true"})
    if head is None:
        return 0, 0
    if not head:
        return None
    robots = content = 0
    for page in range(json.loads(head)["pages"]):
        body = fetch({**query, "page": page})
        if not body:
            return None
        # CDXJ is one JSON object per line. Use split, not splitlines(): splitlines()
        # breaks on several characters that are not newlines, which cuts records in half.
        for line in body.split(b"\n"):
            if not line.strip():
                continue
            try:
                record = json.loads(line)
            except json.JSONDecodeError:
                return None               # the page arrived incomplete
            if record.get("url", "").rstrip("/").endswith("/robots.txt"):
                robots += 1
            else:
                content += 1
        time.sleep(5)
    return robots, content

for domain in DOMAINS:
    result = coverage(domain)
    if result is None:
        print(f"{domain}: no clean response")
    else:
        robots, content = result
        print(f"{domain}: {robots + content} records, {robots} robots.txt, {content} content")
    time.sleep(20)

Ele imprime:

crawl: CC-MAIN-2026-30
theguardian.com: 185 records, 185 robots.txt, 0 content
github.blog: 4700 records, 49 robots.txt, 4651 content

Para CC-MAIN-2026-30, as duas linhas de domínio reproduzem a tabela acima. Um crawl mais recente retorna contagens diferentes; o que deve se manter é o padrão, somente robots para theguardian.com e com conteúdo para github.blog. Registros sem páginas de conteúdo significam que o crawl não contém conteúdo de página desse domínio.

Como consultar cada fonte e o custo do round trip

Ambos os serviços expõem um índice CDX, mas os formatos de resposta diferem: o servidor CDX do Wayback retorna um array JSON de arrays, enquanto o output=json do Common Crawl retorna CDXJ, um objeto JSON por linha.

O servidor CDX do Wayback retorna uma linha por captura, e filtrar no servidor mantém a resposta pequena o suficiente para paginar:

curl "https://web.archive.org/cdx/search/cdx?url=example.com&output=json&from=2026&limit=3&fl=timestamp,original,statuscode"

Isso retorna:

[["timestamp","original","statuscode"],
["20260101000936","http://www.example.com/","200"],
["20260101002937","https://example.com/","200"],
["20260101004445","https://example.com/","200"]]

Para analisar uma página arquivada em vez de renderizá-la, solicite a captura bruta. Adicionar id_ após o timestamp retorna os bytes originais, sem barra de ferramentas e sem links reescritos:

curl -sL "https://web.archive.org/web/2026id_/https://example.com/" -o raw.html
curl -sL "https://web.archive.org/web/2026/https://example.com/"    -o rewritten.html

A cópia reescrita carrega referências injetadas para web.archive.org, o que pode quebrar seletores ancorados na estrutura do DOM.

Além do tipo de correspondência, dois campos em uma linha CDX e um parâmetro de consulta decidem o que uma consulta corresponde, se você pode detectar mudanças e o que custa.

urlkey é a forma SURT da URL. https://github.blog/ é indexado como blog,github)/: host invertido, depois o caminho. Consultas de prefixo e intervalo operam nessa chave em vez da URL que você digitou, razão pela qual o tratamento de www. e a ordem da string de consulta decidem se uma consulta corresponde a algo.

digest é o SHA-1 do payload, codificado em base32, e é o valor que o registro WARC carrega como WARC-Payload-Digest. Um digest hexadecimal não vai corresponder. A detecção de mudanças é, portanto, uma operação de índice: duas linhas compartilhando um digest têm os mesmos bytes de payload.

collapse transforma isso na consulta que você realmente quer. Pedir ao servidor CDX do Wayback todas as capturas de example.com no calendário de 2024 retorna 130.115 linhas. A mesma consulta com collapse=timestamp:8 retorna 366, uma por dia: os timestamps são YYYYMMDDhhmmss, então truncar para oito dígitos colapsa na data. Com collapse=digest, retorna 17.448, uma por mudança entre capturas adjacentes. O índice do Common Crawl aceita o parâmetro e o ignora, retornando as mesmas linhas de qualquer forma.

A paginação via page e pageSize conta blocos de índice, não linhas de resultado, e o tamanho do bloco varia: dois blocos adjacentes em uma consulta retornaram 2.032 e 4.726 registros. Consultar o servidor CDX do Wayback para bbc.com com matchType=domain e pageSize=1 reportou 28.257 páginas.

Uma página pode voltar vazia simplesmente porque seus filtros não corresponderam a nada nesses blocos, o que não significa que o conjunto de resultados terminou. O pageSize padrão é 1, e a documentação não nomeia um máximo.

O índice do Common Crawl pagina da mesma forma, com três diferenças: showNumPages retorna JSON em vez de um número simples, o pageSize padrão é 5 em vez de 1, e seus blocos têm tamanho diferente. Dimensione um loop a partir de showNumPages em vez de um tamanho de bloco assumido, e solicite a contagem de páginas no pageSize que pretende usar, pois a contagem muda com ele.

Há duas maneiras de iterar. O padrão é o modo limit, onde limit e uma chave de retomada percorrem o conjunto de resultados; o modo paginado usa page e pageSize em vez disso. O modo paginado existe para que a contagem de páginas seja conhecida antecipadamente e o trabalho possa ser distribuído entre workers. O modo limit geralmente faz menos solicitações no total, mas em uma URL raramente capturada em um intervalo de datas amplo pode escanear o suficiente para atingir timeout.

O Common Crawl inverte a etapa de busca, e o benefício é que obter uma página custa uma única solicitação de intervalo em vez de um download de arquivo. O índice fornece um nome de arquivo, um deslocamento de byte e um comprimento, então uma solicitação HTTP de intervalo retorna um registro. Como o CDXJ coloca um objeto por linha, o código abaixo lê uma linha em vez de analisar o corpo inteiro:

import gzip, json, urllib.error, urllib.parse, urllib.request

url = "https://example.com/"
crawl = "CC-MAIN-2026-30"
q = urllib.parse.quote(url, safe="")

# Common Crawl asks API clients for a properly formed UserAgent. Use your own.
ua = {"User-Agent": "coverage-check/1.0 ([email protected])"}

# Step 1: ask the index which WARC file and byte range holds this page.
index = f"https://index.commoncrawl.org/{crawl}-index?url={q}&output=json&limit=1"
try:
    req = urllib.request.Request(index, headers=ua)
    rec = json.loads(urllib.request.urlopen(req, timeout=60).read().split(b"\n")[0])
except urllib.error.HTTPError as e:
    if e.code != 404:
        # 502, 503 and 504 all mean try again later, not "not captured".
        # Treating them as a miss under-reports coverage.
        raise
    # A URL this crawl never captured returns 404. That is the normal case for a
    # blocked domain, not an error in your code.
    raise SystemExit(f"{url} is not in {crawl}")

# Step 2: fetch only those bytes.
offset, length = int(rec["offset"]), int(rec["length"])
warc = "https://data.commoncrawl.org/" + rec["filename"]
req = urllib.request.Request(warc, headers={**ua, "Range": f"bytes={offset}-{offset + length - 1}"})
record = gzip.decompress(urllib.request.urlopen(req, timeout=60).read())

print(record.decode("utf-8", "replace")[:400])

Isso retorna um registro WARC comprimido com gzip contendo os cabeçalhos de resposta e o HTML da página. Em 29 registros de conteúdo amostrados, o tamanho comprimido variou de 7 a 45 KiB, então a solicitação de intervalo move kilobytes de um arquivo de cerca de 900 MiB. O mesmo caminho funciona para qualquer crawl listado pelo servidor de índice.

Para trabalho em escala de corpus, o URL Index do Common Crawl fornece o mesmo índice como Parquet com colunas extras, publicado em s3://commoncrawl/cc-index/table/cc-main/warc/ e consultável com DuckDB localmente ou Athena na AWS. O Common Crawl coloca o índice colunar em aproximadamente 300 GB por crawl mensal e uma varredura completa do Athena em cerca de $1,50 em setembro de 2025, então a maioria das consultas filtradas custa menos. O acesso aos dados em si é gratuito pelo programa AWS Open Data, e data.commoncrawl.org não requer conta AWS, embora a saída do seu próprio provedor de nuvem ainda seja por sua conta.

Limites de taxa e cotas que você vai encontrar

O FAQ do Common Crawl diz que o endpoint CDX “é frequentemente abusado e, portanto, fortemente limitado por taxa”. Um HTTP 503 significa desacelere, e um IP temporariamente bloqueado deve aguardar 24 horas. A orientação também pede que você durma entre as chamadas, evite múltiplas threads de um único IP, evite redes de Proxy e envie um User-Agent adequadamente formado, que seu FAQ vincula ao RFC 9110. A cláusula de Proxy é a que merece atenção. O bloqueio do FAQ e sua orientação de threading são ambos endereçados ao IP, então distribuir um trabalho por mais endereços contorna o limite em vez de respeitá-lo, e a escalada é um bloqueio no endereço em vez de mais 503s.

O Internet Archive publica cotas para o Save Page Now e efetivamente nada para as APIs de leitura. A especificação do Save Page Now 2 fornece estes limites:

Limite Autenticado Anônimo
Capturas por minuto 7 3
Capturas por dia 30.000 200
Bytes arquivados por dia 5 GB 2 GB
Capturas da mesma URL por dia 5 5

A especificação não nomeia nenhum nível pago acima desses números e direciona usuários mais intensos a enviar e-mail ao Internet Archive. A especificação fornece o valor anônimo como 2 GB e 500 MB, e seu changelog reduziu o valor autenticado para 4 GiB enquanto a tabela ainda diz 5 GB.

Para as APIs de leitura, os números vêm de fora do Internet Archive. O mantenedor do cliente Python wayback registrou uma conversa com a equipe do Internet Archive e codificou o resultado como padrões da biblioteca. O registro não é uma publicação do Internet Archive.

Os endpoints /cdx/search/cdx e /web/timemap/ agora são um serviço nos mesmos servidores, diferindo apenas em como leem o parâmetro output, e compartilham um único pool de limite de taxa. Esse pool é de 30 solicitações por minuto entre os dois. O registro não diz se o contador é vinculado a um endereço ou a uma conta, então um trabalho distribuído entre workers não pode assumir que o orçamento se multiplica. O endpoint de memento serve reprodução e usa um pool separado.

A biblioteca codifica esses limites como seus padrões, 0.8 * 30 / 60 para CDX e 0.8 * 600 / 60 para reprodução, depois que a equipe do Internet Archive pediu que os clientes ficassem em 80% dos limites rígidos. Isso é 24 solicitações por minuto em vez de 30, e 480 para reprodução. Projete com base nesses valores, não nos limites máximos.

O endpoint de disponibilidade em archive.org/wayback/available é um terceiro serviço sem limite próprio publicado, então trate-o como limitado em vez de livre. Respeite Retry-After quando a resposta o carregar. Quando não o carrega, o cliente wayback faz uma pausa de 60 segundos antes de tentar novamente.

Por que capturas do archive.today não podem ser verificadas sozinhas

O archive.today renderiza páginas em um navegador no momento da captura e ignora o robots.txt, então contém páginas que a Wayback Machine não tem. Fluxos de trabalho de citação adotaram o archive.today por essa cobertura.

O archive.today armazena HTML mutável em vez de WARC, então não há digest de payload e nada dentro da captura para verificá-la. Evidências foram apresentadas de que seus operadores alteraram páginas arquivadas, e a Wikipedia depreciou o site e o adicionou à lista negra de spam. A declaração de encerramento começa com um fundamento diferente: afirma que o site incorporou código que transformou os navegadores dos visitantes em um ataque de negação de serviço contra um blog, e trata os snapshots alterados como adicionais.

Reverifique qualquer coisa que você já cite do archive.today em uma segunda fonte. A mesma página registra que o código ainda estava presente em junho de 2026 a uma taxa de chamadas reduzida, e instrui quem precisar do site a carregá-lo por trás de um bloqueador de conteúdo.

Arquivos nacionais, formatos e ferramentas de reprodução

Arquivo.pt: o arquivo nacional da web português executa uma API de busca em texto completo que a Wayback Machine não tem. Um GET para arquivo.pt/textsearch retorna JSON com um linkToExtractedText por resultado, então você pula o parsing de HTML completamente. A API é gratuita e não requer chave, e o limite documentado é de 250 solicitações por 60 segundos de um IP, compartilhado entre busca em texto completo e busca de URL em vez de orçamentos separados. Exceder esse limite está documentado como motivo para bloqueio permanente, enquanto o bloqueio do Common Crawl é temporário. A cobertura é focada em Portugal, e a latência é irregular, de menos de 3 segundos a 18 em três consultas de resultado único, então defina o timeout do cliente para 30 segundos.

WARC e WACZ: WARC é o contêiner de arquivamento, padronizado como ISO 28500:2017, que cobre o WARC 1.1. Não existe WARC 1.2. O WACZ empacota registros WARC com um índice CDX para que um navegador possa reproduzi-los sem um servidor. Um rascunho 1.2.0 está disponível, mas wacz/latest ainda serve 1.1.1, então implemente contra 1.1.1.

Browsertrix: quando você precisa de capturas que controla, o crawler do Webrecorder produz arquivos WACZ que são reproduzidos em um navegador pelo ReplayWeb.page sem servidor. Os planos hospedados começam em $30 por mês para o plano básico, e o crawler é open source se você preferir executá-lo você mesmo.

Como escolher

Comece pelo formato da pergunta: URLs específicas, texto em massa ou uma propriedade que nenhum serviço oferece.

Use a Wayback Machine quando a URL e a data são o ponto. Recuperar uma página deletada, provar o que um site dizia antes de uma edição, rastrear uma página de produto ao longo do tempo ou reconstruir um conjunto de documentação extinto. Nenhuma outra opção de uso geral corresponde à sua profundidade temporal em URLs individuais, embora um arquivo nacional possa correspondê-la dentro de seu próprio escopo.

Se o uso for probatório, planeje mais do que a captura. Tribunais dos EUA admitiram capturas do Wayback, mas uma impressão sozinha raramente é suficiente, pois as capturas não se autenticam. Uma declaração do Internet Archive é o caminho que os tribunais aceitaram, e nas taxas publicadas no início de 2025 custa $250 por solicitação mais $20 por cada URL, ou $30 para URLs contendo um arquivo para download como um PDF.

Use o Common Crawl quando você quer muitas páginas e não se importa com quais. Corpora de linguagem, pré-treinamento de modelos, análise de grafo de links, pesquisa de segurança em muitos hosts e qualquer medição onde uma amostra distorcida por ranking é aceitável. A maioria dos grandes corpora de pré-treinamento abertos se baseia nele, incluindo C4, RefinedWeb, FineWeb e Dolma. Se você quiser um corpus em vez do crawl bruto, esses derivados e suas licenças valem a pena ser lidos primeiro, e nossa pesquisa de fontes de dados de treinamento de LLM é um ponto de partida. Não o use para garantir cobertura de um site nomeado, pois a política de amostragem torna a cobertura imprevisível.

Um estudo de Sichang Steven He e colegas classificou cerca de 100.000 sites no Common Crawl e encontrou 6,0% deles dominados por texto gerado com pouca contribuição humana. Entre sites vistos pela primeira vez no primeiro semestre de 2025, a parcela era de 29,4%, acima de 2,1% entre sites vistos pela primeira vez no final de 2022.

Leia o 6,0% e o 29,4% como prováveis subestimativas. Os autores relatam uma forte correlação negativa entre a precisão do classificador e a pontuação de benchmark do modelo que gerou um site, então a parcela que o classificador perde cresce à medida que os geradores melhoram.

Use um arquivo nacional ou auto-hospedado quando precisar de uma propriedade que nenhum serviço oferece. Busca em texto completo sobre conteúdo arquivado, capturas que você controla de ponta a ponta ou páginas renderizadas pelo cliente que são reproduzidas mal em outros lugares.

O archive.today é excluído por um motivo diferente: uma captura que pode mudar após o fato não pode se sustentar sozinha como evidência.

Para trabalho em massa em muitos hosts, consulte o Common Crawl primeiro pela amplitude e custo, depois recorra à Wayback Machine para o que o crawl perdeu. Para uma lista de URLs conhecida, faça o contrário: a maioria das consultas ao Common Crawl vai errar, e cada consulta gasta uma solicitação contra um índice cuja penalidade documentada por uso excessivo é um bloqueio de 24 horas. E quando um domínio importa para o seu trabalho a longo prazo, execute suas próprias capturas com um crawler que produz WARC em paralelo, pois essa é uma cópia cuja disponibilidade você controla.

Executar seu próprio crawler custa armazenamento, infraestrutura de reprodução e um encargo de manutenção que nenhum serviço público cobra de você, então execute-o você mesmo onde perder o acesso quebraria algo, e apoie-se nos arquivos públicos ou em coleções compradas para o restante.

Quando você precisa de coleta em vez de um arquivo

Nenhum dos serviços foi criado para coletar um conjunto definido de sites em um cronograma. O Save Page Now coleta sob demanda e opera a 7 capturas por minuto quando autenticado, 3 quando não.

Todos os quatro domínios de notícias que consultamos não tinham páginas de conteúdo no CC-MAIN-2026-30. Nenhum publica garantia de cobertura, SLA ou compromisso de suporte contra o qual você possa escalar.

Quando você precisa de sites nomeados coletados em um cronograma, com cobertura que você define, isso é um produto de coleta em vez de um arquivo. O crawling descobre o que está disponível; a coleta direcionada retorna páginas conhecidas sob demanda. Nosso guia de crawling vs scraping trabalha a diferença.

Pagar pela coleta não compra uma isenção de bloqueio. Publicadores restringem crawlers comerciais assim como crawlers de arquivo; um fornecedor muda quem carrega a manutenção quando um site muda suas defesas.

A Bright Data vende coleta direcionada: a API Web Scraper a $1 por 1.000 registros, com os primeiros 5.000 por mês gratuitos, e conjuntos de dados prontos a partir de $0,0025 por registro com mínimo de $250. Ambos cobrem sites suportados de forma contínua. Nenhum substitui a Wayback Machine, e o motivo é um intervalo de datas: os dados pré-coletados alcançam dias a meses, não até 1996, então uma pergunta sobre o que uma página dizia em 2014 ainda vai para o arquivo.

Próximos passos

Execute o script de cobertura nos domínios que você se importa, depois verifique os mesmos domínios no servidor CDX do Wayback para densidade de captura.

Registros de conteúdo dizem se o trabalho em massa é possível; a densidade de captura diz se o histórico no nível de URL é possível. Uma contagem saudável é uma leitura, não um compromisso: a política de amostragem não promete um piso, e os totais por crawl caíram cerca de um quarto desde 2024, então re-execute a verificação antes de depender dela.

Capture o que importa agora onde perder o acesso quebraria algo, compre coleta para o restante, mantenha o que você captura em WARC para que permaneça portátil, e trate ambos os arquivos públicos como fontes que você consulta em vez de armazenamento do qual depende.

Perguntas frequentes

Posso usar o Common Crawl comercialmente?

Os termos de uso permitem e colocam o risco em você. O Common Crawl limita sua responsabilidade total a $100 e exige que você o indenize por reclamações decorrentes do uso de conteúdo rastreado para desenvolver, treinar ou implantar sistemas de IA. O Common Crawl recomenda aconselhamento jurídico antes de qualquer uso comercial.

É possível baixar todos os dados da Wayback Machine?

Não em massa. O Internet Archive não publica exportação em massa do arquivo geral da web, e o acesso ocorre por meio de APIs com limite de taxa. Para análise em escala de pesquisa, o Internet Archive oferece o ARCH, sua plataforma de computação, que é apenas por cotação e não tem preços publicados.

Qual taxa devo usar ao projetar um cliente Wayback CDX?

Projete para 24 solicitações por minuto. O limite é de 30 por minuto, que o Internet Archive não publica, compartilhado entre os endpoints CDX e timemap desde que se tornaram um serviço, e o cliente wayback usa 80% disso como padrão. A reprodução é um pool separado de 600 por minuto, então projete para 480 lá.

Por que uma consulta de domínio no Common Crawl retorna registros mas sem conteúdo?

Porque esses registros são buscas de robots.txt. O CCBot solicita robots.txt de cada host que toca, e quando um site o proíbe, essa solicitação e qualquer redirecionamento para ela são tudo que o crawl retém. Classifique as URLs retornadas antes de concluir que um domínio está coberto, e informe seu tipo de correspondência, pois uma consulta de prefixo e uma consulta de domínio podem retornar contagens diferentes.