---
title: "Web Scraping com o Gemini em 2026: Tutorial completo"
slug: web-scraping-with-gemini
date: 2025-05-05T12:42:34+00:00
modified: 2025-11-04T08:53:05+00:00
permalink: https://brightdata.com.br/blog/dados-do-site/web-scraping-with-gemini
type: blog
---

[ Blog ](https://brightdata.com.br/blog "Blog") / [Dados do site](https://brightdata.com.br/blog/dados-do-site)







 [Dados do site](https://brightdata.com.br/blog/dados-do-site)

# Web Scraping com o Gemini em 2026: Tutorial completo

Descubra como aproveitar o Gemini AI para raspagem da Web em Python, automatizar a extração de dados e superar os desafios de raspagem com este guia.

 18 min de leitura





 [ ![Antonello Zanini](https://media.brightdata.com.br/2022/12/Antonello-Zanini-2-50x50.jpg) ](https://brightdata.com/blog/authors/antonello-zanini)

 [Antonello Zanini

Technical Writer

 ](https://brightdata.com/blog/authors/antonello-zanini)





 ![Web Scraping with Gemini blog image](https://media.brightdata.com.br/2025/03/Web-Scraping-with-Gemini.svg)





Neste guia, você aprenderá:

- Por que o Gemini é uma ótima solução para a coleta de dados da Web com tecnologia de IA
- Como usá-lo para extrair dados de um site em Python por meio de um tutorial guiado
- A maior limitação dessa forma de raspagem da Web e como superá-la

Vamos mergulhar de cabeça!

## Por que usar o Gemini para Web Scraping?

[O Gemini](https://gemini.google.com/) é uma família de modelos de IA multimodal desenvolvida pelo Google que pode analisar e interpretar textos, imagens, áudio, vídeos e códigos. O uso do Gemini para raspagem da Web simplifica a extração de dados, automatizando a interpretação e a estruturação de conteúdo não estruturado. Isso elimina a necessidade de esforço manual, especialmente quando se trata de [análise de dados](/blog/dados-do-site/what-is-data-parsing).

Em detalhes, esses são alguns dos casos de uso mais comuns do Gemini em raspagem da Web:

- **Páginas que mudam de estrutura com frequência**: O Gemini pode lidar com páginas dinâmicas em que o layout ou os elementos de dados mudam com frequência, como em [sites de comércio eletrônico como a Amazon](/blog/procedimentos/how-to-scrape-amazon).
- **Páginas com muitos dados não estruturados**: Ele se destaca na extração de informações úteis de grandes volumes de texto não organizado.
- **Páginas em que é difícil escrever uma lógica de análise personalizada**: Para páginas com estruturas complexas ou imprevisíveis, o Gemini pode automatizar o processo sem exigir regras de análise complexas.

Os cenários de uso comum do Gemini em raspagem da Web incluem:

- **RAG (Retrieval-Augmented Generation)**: Combinação de raspagem de dados em tempo real para aprimorar os insights de IA. Para obter um exemplo completo usando uma tecnologia de IA semelhante, siga nosso tutorial sobre [como criar um chatbot RAG usando dados SERP](/blog/dados-do-site/build-a-rag-chatbot).
- **Raspagem de mídia social**: Coleta de dados estruturados de plataformas com conteúdo dinâmico.
- **Agregação de conteúdo**: Reunir notícias, artigos ou postagens de blog de várias fontes para criar resumos ou análises.

Para obter mais informações, consulte nosso guia sobre [o uso de IA para raspagem da Web](/blog/dados-do-site/ai-web-scraping).

## Web Scraping com Gemini em Python: Guia passo a passo

Como site de destino desta seção, usaremos uma página de produto específica do sandbox “[Ecommerce Test Site to Learn Web Scraping](https://www.scrapingcourse.com/ecommerce/product/adrienne-trek-jacket/)“:

![A página da Web de destino](https://media.brightdata.com/2025/03/The-target-web-page-1024x688.png)Esse é um ótimo exemplo porque a maioria das páginas de produtos de comércio eletrônico exibe diferentes tipos de dados ou tem estruturas variadas. Isso é o que torna [a raspagem da Web de comércio eletrônico](/blog/procedimentos/ecommerce-web-scraping-guide) tão desafiadora e onde a IA pode ajudar.

O objetivo do nosso raspador com tecnologia Gemini é aproveitar a IA para extrair detalhes do produto da página sem escrever uma lógica de análise manual. Os dados do produto recuperados por meio de IA incluirão:

- SKU
- Nome
- Imagens
- Preço
- Descrição
- Tamanhos
- Cores
- Categoria

Siga as etapas abaixo para saber como realizar a coleta de dados da Web com o Gemini!

### Etapa 1: Configuração do projeto

Antes de começar, verifique se você tem o Python 3 instalado em seu computador. Caso contrário, [faça o download](https://www.python.org/downloads/) e siga o assistente de instalação.

Agora, execute o seguinte comando para criar uma pasta para seu projeto de raspagem:

```none
mkdir gemini-scraper
```

`gemini-scraper` representa a pasta do projeto do seu coletor de dados da Web baseado em Python Gemini.

Navegue até ele no terminal e inicialize um [ambiente virtual](https://docs.python.org/3/library/venv.html) dentro dele:

```none
cd gemini-scraper
python -m venv venv
```

Carregue a pasta do projeto em seu IDE Python favorito. [O Visual Studio Code com a extensão Python](https://code.visualstudio.com/docs/languages/python) ou [o PyCharm Community Edition](https://www.jetbrains.com/pycharm/download/#section=windows) são duas ótimas opções.

Crie um arquivo `scraper.py` na pasta do projeto, que agora deve conter essa estrutura de arquivo:

![A estrutura de arquivos do Gemini-Powered Scraper](https://media.brightdata.com/2025/03/The-file-structure-of-the-Gemini-Powered-Scraper.png)Atualmente, `o scraper.py` é um script Python em branco, mas em breve conterá a lógica de raspagem LLM desejada.

No terminal do IDE, ative o ambiente virtual. No Linux ou macOS, execute este comando:

```none
./venv/bin/activate
```

De forma equivalente, no Windows, execute:

```none
venv/Scripts/activate
```

Maravilhoso! Agora você tem um ambiente Python para coleta de dados da Web com o Gemini.

### Etapa 2: Configurar o Gemini

O Gemini fornece uma API que você pode chamar usando qualquer cliente HTTP, inclusive `solicitações`. Ainda assim, é melhor se conectar por meio do [Google AI Python SDK](https://github.com/google-gemini/generative-ai-python) oficial [para a API do Gemini](https://github.com/google-gemini/generative-ai-python). Para instalá-lo, execute o seguinte comando no ambiente virtual ativado:

```none
pip install google-generativeai
```

Em seguida, importe-o em seu arquivo `scraper.py`:

```none
import google.generativeai as genai
```

Para que o SDK funcione, você precisa de uma chave de API Gemini. Se você ainda não recuperou sua chave de API
[siga a documentação oficial do Google](https://ai.google.dev/gemini-api/docs/api-key). Especificamente, faça login na sua conta do Google e entre no Google AI Studio. Navegue até a página[“Get API Key](https://aistudio.google.com/app/apikey)” e você verá o seguinte modal:

![Observe o botão "Get API key" (Obter chave de API)](https://media.brightdata.com/2025/03/Note-the-Get-API-key-button-1024x614.png)Clique no botão “Get API key” (Obter chave de API), e a seção a seguir será exibida:

![Observe o botão "Create API key" (Criar chave de API)](https://media.brightdata.com/2025/03/Note-the-Create-API-key-button-1024x502.png)Agora, pressione “Create API key” (Criar chave de API) para gerar sua chave de API do Gemini:

![Sua nova chave de API Gemini](https://media.brightdata.com/2025/03/Your-new-Gemini-API-key-1024x265.png)Copie a chave e guarde-a em um local seguro.

**Observação**: a camada gratuita do Gemini é suficiente para este exemplo. A camada paga só é necessária se você precisar de limites de taxa mais altos ou quiser garantir que seus avisos e respostas não sejam usados para melhorar os produtos do Google. Para obter mais detalhes, consulte a [página de faturamento do Gemini](https://ai.google.dev/gemini-api/docs/api-key).

Para usar a chave da API do Gemini no Python, você pode defini-la como uma variável de ambiente:

```none
export GEMINI_API_KEY=<YOUR_GEMINI_API_KEY>
```

Ou, como alternativa, armazene-o diretamente em seu script Python como uma constante:

```none
GEMINI_API_KEY="<YOUR_GEMINI_API_KEY>"
```

E passe-o para o `genai` como uma configuração, da seguinte forma:

```none
genai.configure(api_key=GEMINI_API_KEY)
```

Nesse caso, seguiremos a segunda abordagem. No entanto, lembre-se de que ambos os métodos funcionam, pois `o google-generativeai` tenta ler automaticamente a chave de API de `GEMINI_API_KEY` se você não a passar manualmente.

Incrível! Agora você pode usar o Gemini SDK para fazer solicitações de API para o LLM em Python.

### Etapa 3: obtenha o HTML da página de destino

Para conectar-se ao servidor de destino e recuperar o HTML de suas páginas da Web, usaremos o Requests, o [cliente HTTP mais popular em Python](/blog/dados-do-site/best-python-http-clients). Em um ambiente virtual ativado, instale-o com:

```none
pip install requests
```

Em seguida, importe-o no `scraper.py`:

```none
import requests
```

Use-o para enviar uma solicitação `GET` à página de destino e recuperar seu documento HTML:

```none
url = "https://www.scrapingcourse.com/ecommerce/product/adrienne-trek-jacket/"
response = requests.get(url)
```

`response.content` agora conterá o HTML bruto da página. É hora de analisá-lo e se preparar para extrair dados dele!

### Etapa 4: converter o HTML em Markdown

Se você comparar outras tecnologias de raspagem de IA, como o [Crawl4AI](https://docs.crawl4ai.com/), perceberá que elas permitem que você use seletores CSS para direcionar elementos HTML. Em seguida, essas bibliotecas convertem o HTML dos elementos selecionados em texto Markdown. Por fim, elas processam esse texto com um LLM.

Já se perguntou por quê? Bem, há dois motivos principais para esse comportamento:

1. Reduzir o número de tokens enviados para a IA, ajudando você a economizar dinheiro (já que nem todos os provedores de LLM são gratuitos como a Gemini).
2. Tornar o processamento de IA mais rápido, pois menos dados de entrada significam custos computacionais mais baixos e respostas mais rápidas.

Para obter um passo a passo completo, consulte nosso guia sobre [raspagem da Web usando o CrawlAI e o DeepSeek](/blog/dados-do-site/crawl4ai-and-deepseek-web-scraping).

Vamos tentar replicar essa lógica e ver se ela realmente faz sentido. Comece inspecionando a página de destino, abrindo-a em uma janela anônima (para abrir uma nova sessão). Em seguida, clique com o botão direito do mouse em qualquer lugar da página e selecione a opção “Inspecionar”.

Examine a estrutura da página. Você verá que todos os dados relevantes estão contidos no elemento HTML identificado pelo seletor CSS `#main`:

![O elemento #main HTML contém todos os dados de interesse](https://media.brightdata.com/2025/03/The-main-HTML-element-contains-all-the-data-of-interest-1024x711.png)Você poderia enviar todo o HTML bruto para o Gemini, mas isso introduziria muitas informações desnecessárias (como cabeçalhos e rodapés). Em vez disso, ao passar apenas o conteúdo `#main`, você reduz o ruído e evita alucinações da IA.

Para selecionar apenas `#main`, você precisa de uma [ferramenta de análise de HTML do Python](/blog/dados-do-site/best-python-html-parsers), como a Beautiful Soup. Portanto, instale-a com:

```none
pip install beautifulsoup4
```

Se você não estiver familiarizado com sua sintaxe, consulte nosso guia sobre [raspagem da Web da Beautiful Soup](/blog/procedimentos/beautiful-soup-web-scraping).

Agora, importe-o no `scraper.py`:

```none
from bs4 import BeautifulSoup
```

Use o Beautiful Soup para analisar o HTML bruto recuperado via Requests, selecionar o elemento `#main` e extrair seu HTML:

```none
# Parse the HTML with BeautifulSoup
soup = BeautifulSoup(response.content, "html.parser")

# Extract the #main element
main_element = soup.select_one("#main")

# Get its outer HTML
main_html = str(main_element)
```

Se você imprimir `main_html`, verá algo parecido com isto:

```none
<main id="main" class="site-main" role="main" data-testid="main-content" data-content="main-area">
    <!-- omitted for brevity... -->
</main>
```

Agora, verifique quantos tokens esse HTML geraria e estime o custo se você estivesse usando a camada paga da Gemini. Para fazer isso, use uma ferramenta como a [Token Calculator](https://token-calculator.net/):

![O uso de tokens e a previsão de preços a partir do uso do HTML #main bruto](https://media.brightdata.com/2025/03/The-token-usage-and-price-prediction-from-using-the-raw-main-HTML-1024x510.png)Como você pode ver, essa abordagem equivale a quase 20.000 tokens, custando cerca de US$ 0,25 por solicitação para o Gemini 1.5 Pro. Em um projeto de raspagem em grande escala, isso pode facilmente se tornar um problema!

Tente converter o HTML extraído em Markdown – semelhante ao que o Crawl4AI faz. Primeiro, instale uma biblioteca HTML para Markdown, como a [`markdownify`](https://github.com/matthewwithanm/python-markdownify):

```none
pip install markdownify
```

Importar `markdownify` em `scraper.py`:

```none
from markdownify import markdownify
```

Em seguida, use `o markdownify` para converter o HTML extraído em Markdown:

```none
main_markdown = markdownify(main_html)
```

A string `main_markdown` resultante contém algo parecido com isto:

```none
[![](https://www.scrapingcourse.com/ecommerce/wp-content/uploads/2024/03/wj08-gray_main-416x516.jpg "wj08-gray_main.jpg")](https://www.scrapingcourse.com/ecommerce/wp-content/uploads/2024/03/wj08-gray_main.jpg)

[![](https://www.scrapingcourse.com/ecommerce/wp-content/uploads/2024/03/wj08-gray_alt1-416x516.jpg "wj08-gray_alt1.jpg")](https://www.scrapingcourse.com/ecommerce/wp-content/uploads/2024/03/wj08-gray_alt1.jpg)

[![](https://www.scrapingcourse.com/ecommerce/wp-content/uploads/2024/03/wj08-gray_alternate-416x516.jpg "wj08-gray_alternate.jpg")](https://www.scrapingcourse.com/ecommerce/wp-content/uploads/2024/03/wj08-gray_alternate.jpg)

[![](https://www.scrapingcourse.com/ecommerce/wp-content/uploads/2024/03/wj08-gray_back-416x516.jpg "wj08-gray_back.jpg")](https://www.scrapingcourse.com/ecommerce/wp-content/uploads/2024/03/wj08-gray_back.jpg)

Adrienne Trek Jacket
====================

$57.00

This is a variable product called a Adrienne Trek Jacket

|  |  |
| --- | --- |
| Size | Choose an optionXSSMLXL |
| Color | Choose an optionGrayOrangePurple[Clear](#) |

Adrienne Trek Jacket quantity

Add to cart

SKU: WJ08
Category: [Erin Recommends|Clothing](https://www.scrapingcourse.com/ecommerce/product-category/clothing/women/tops-women/jacketsclothing-tops-women/promotions-jacketsclothing-tops-women/women-saleclothing-promotions-jacketsclothing-tops-women/collections-women-saleclothing-promotions-jacketsclothing-tops-women/erin-recommendsclothing-collections-women-saleclothing-promotions-jacketsclothing-tops-women/)

* [Description](#tab-description)
* [Additional information](#tab-additional_information)

Description
-----------

You’re ready for a cross-country jog or a coffee on the patio in the Adrienne Trek Jacket. Its style is unique with stand collar and drawstrings, and it fits like a jacket should.

* gray 1/4 zip pullover.
* Comfortable, relaxed fit.
* Front zip for venting.
* Spacious, kangaroo pockets.
* 27″ body length.
* 95% Organic Cotton / 5% Spandex.

Additional information
----------------------

|  |  |
| --- | --- |
| Size | XS, S, M, L, XL |
| Color | Gray, Orange, Purple |
```

Essa versão Markdown dos dados de entrada é muito menor do que o HTML `#principal` original e, ao mesmo tempo, contém todos os principais dados necessários para a raspagem.

Use a Token Calculator novamente para verificar quantos tokens a nova entrada consumiria:
![](https://paper-attachments.dropboxusercontent.com/s_A524C2D11FF2386556393C858EA6E65DFD7FBA45AC5120E9D9A9E966DD6EF363_1742286407912_image.png)

Uau, reduzimos 19.858 tokens para 765 tokens – uma redução de 95%!

### Etapa 5: usar o LLM para extrair dados

Para realizar a coleta de dados da Web com o Gemini, siga estas etapas:

1. Escreva um prompt bem estruturado para extrair os dados desejados da entrada Markdown. Certifique-se de definir os atributos que você deseja que o resultado tenha.
2. Envie uma solicitação a um modelo Gemini LLM usando `o genai`, configurando-o para que a solicitação retorne dados formatados em JSON.
3. Analisar o JSON retornado.

Implemente a lógica acima com estas linhas de código:

```none
# Extract structured data using Gemini
prompt = f"""Extract data from the content below. Respond with a raw string in JSON format containing the scraped data in the specified attributes:nn
JSON ATTRIBUTES: n
sku, name, images, price, description, sizes, colors, category

CONTENT:n
{main_markdown}
"""
model = genai.GenerativeModel("gemini-2.0-flash-lite", generation_config={"response_mime_type": "application/json"})
response = model.generate_content(prompt)

# Get the response and parse it from JSON
product_raw_string = response.text
product_data = json.loads(product_raw_string)
```

A variável `prompt` instrui o Gemini a extrair dados estruturados do conteúdo `main_markdown`. Em seguida, `genai.GenerativeModel()` define o modelo `"gemini-2.0-flash-lite"` para executar a solicitação LLM. Por fim, a string de resposta bruta no formato JSON é convertida em um dicionário Python utilizável com [`json.loads()`](https://docs.python.org/3/library/json.html#json.loads).

Observe a configuração `"application/json"` para dizer ao Gemini para retornar dados JSON.

Não se esqueça de importar `json` da biblioteca padrão do Python:

```none
import json
```

Agora que você tem os dados extraídos em um dicionário `product_data`, pode acessar seus campos para processamento adicional de dados, como no exemplo abaixo:

```none
price = product_data["price"]
price_eur = price * USD_EUR
# ...
```

Fantástico! Você acabou de utilizar o Gemini para coleta de dados da Web. Só falta exportar os dados extraídos.

### Etapa nº 6: Exportar os dados extraídos

Atualmente, você tem os dados extraídos armazenados em um dicionário Python. Para exportá-los para um arquivo JSON, use o seguinte código:

```none
with open("product.json", "w", encoding="utf-8") as json_file:
    json.dump(product_data, json_file, indent=4)
```

Isso criará um arquivo `product.json` contendo os dados extraídos no formato JSON.

Parabéns! O coletor de dados da Web com tecnologia Gemini está concluído.

### Etapa nº 7: Juntar tudo

Abaixo está o código completo de seu script de raspagem Gemini:

```none
import google.generativeai as genai
import requests
from bs4 import BeautifulSoup
from markdownify import markdownify
import json

# Your Gemini API key
GEMINI_API_KEY = "<YOUR_GEMINI_API_KEY>"

# Set up the Google Gemini API
genai.configure(api_key=GEMINI_API_KEY)

# Fetch the HTML content of the target page
url = "https://www.scrapingcourse.com/ecommerce/product/adrienne-trek-jacket/"
response = requests.get(url)

# Parse the HTML of the target page with BeautifulSoup
soup = BeautifulSoup(response.content, "html.parser")

# Select the #main element
main_element = soup.select_one("#main")

# Get its outer HTML and convert it to Markdown
main_html = str(main_element)
main_markdown = markdownify(main_html)

# Extract structured data using Gemini
prompt = f"""Extract data from the content below. Respond with a raw string in JSON format containing the scraped data in the specified attributes:nn
JSON ATTRIBUTES: n
sku, name, images, price, description, sizes, colors, category

CONTENT:n
{main_markdown}
"""
model = genai.GenerativeModel("gemini-2.0-flash-lite", generation_config={"response_mime_type": "application/json"})
response = model.generate_content(prompt)

# Get the response and parse it from JSON
product_raw_string = response.text
product_data = json.loads(product_raw_string)

# Futher data processing... (optional)

# Export the scraped data to JSON
with open("product.json", "w", encoding="utf-8") as json_file:
    json.dump(product_data, json_file, indent=4)
```

Inicie o script com:

```none
python scraper.py
```

Uma vez executado, um arquivo `product.json` aparecerá na pasta do projeto. Abra-o e você verá dados estruturados como estes:

```none
{
    "sku": "WJ08",
    "name": "Adrienne Trek Jacket",
    "images": [
        "https://www.scrapingcourse.com/ecommerce/wp-content/uploads/2024/03/wj08-gray_main-416x516.jpg",
        "https://www.scrapingcourse.com/ecommerce/wp-content/uploads/2024/03/wj08-gray_alt1-416x516.jpg",
        "https://www.scrapingcourse.com/ecommerce/wp-content/uploads/2024/03/wj08-gray_alternate-416x516.jpg",
        "https://www.scrapingcourse.com/ecommerce/wp-content/uploads/2024/03/wj08-gray_back-416x516.jpg"
    ],
    "price": "$57.00",
    "description": "Youu2019re ready for a cross-country jog or a coffee on the patio in the Adrienne Trek Jacket. Its style is unique with stand collar and drawstrings, and it fits like a jacket should.nnu2022 gray 1/4 zip pullover.  nu2022 Comfortable, relaxed fit.  nu2022 Front zip for venting.  nu2022 Spacious, kangaroo pockets.  nu2022 27u2033 body length.  nu2022 95% Organic Cotton / 5% Spandex.",
    "sizes": [
        "XS",
        "S",
        "M",
        "L",
        "XL"
    ],
    "colors": [
        "Gray",
        "Orange",
        "Purple"
    ],
    "category": "Erin Recommends|Clothing"
}
```

E pronto! Você começou com dados não estruturados em uma página HTML e agora os tem em um arquivo JSON estruturado, graças à coleta de dados da Web com tecnologia Gemini.

### Próximas etapas

Para levar seu raspador com motor Gemini para o próximo nível, considere estas melhorias:

- **Torne-o reutilizável**: Modifique o script para aceitar o prompt e o URL de destino como argumentos de linha de comando. Isso o tornará de uso geral e adaptável a diferentes cenários de uso.
- **Implementar o rastreamento da Web**: Amplie o coletor de dados para lidar com sites de várias páginas, [adicionando lógica para rastreamento e paginação](/blog/dados-do-site/pagination-web-scraping).
- **Proteja as credenciais da API**: Armazene sua chave de API Gemini em um arquivo `.env` e use [`python-dotenv`](https://pypi.org/project/python-dotenv/) para carregá-la. Isso evita a exposição de sua chave de API no código.

## Superando a principal limitação dessa abordagem de raspagem da Web

Qual é a maior limitação dessa abordagem de raspagem da Web? A solicitação HTTP feita pelas solicitações!

Claro, no exemplo acima, funcionou perfeitamente, mas isso se deve ao fato de o site alvo ser apenas um playground de raspagem da Web. Na realidade, as empresas e os proprietários de sites sabem o quanto seus dados são valiosos, mesmo quando estão acessíveis ao público. Para protegê-los, eles implementam [medidas antirraspagem](/blog/dados-do-site/anti-scraping-techniques) que podem bloquear facilmente suas solicitações HTTP automatizadas.

Além disso, a abordagem acima [não funcionará em sites dinâmicos](/blog/procedimentos/scrape-dynamic-websites-python) que dependem do JavaScript para renderização ou obtenção de dados de forma assíncrona. Portanto, os sites não precisam nem mesmo de estruturas antirrastreamento avançadas para impedir seu raspador. O uso de carregamento de conteúdo baseado em JavaScript é suficiente.

A solução para todos esses problemas? [Uma API de desbloqueio da Web!](/products/web-unlocker)

Uma API do Web Unlocker é um ponto de extremidade HTTP que você pode chamar de qualquer cliente HTTP. A principal diferença? Ela retorna o HTML totalmente desbloqueado de qualquer URL que você passar para ela, contornando qualquer bloqueio anti-scraping. Não importa quantas proteções um site-alvo tenha, uma simples solicitação ao Web Unlocker buscará o HTML da página para você.

Para começar a usar essa ferramenta e recuperar sua chave de API, [siga a documentação oficial do Web Unlocker](https://docs.brightdata.com/scraping-automation/web-unlocker/quickstart). Em seguida, substitua seu código de solicitação existente da “Etapa 3” por estas linhas:

```none
WEB_UNLOCKER_API_KEY = "<YOUR_WEB_UNLOCKER_API_KEY>"

# Set up authentication headers for Web Unlocker
headers = {
    "Content-Type": "application/json",
    "Authorization": f"Bearer {WEB_UNLOCKER_API_KEY}"
}

# Define the request payload
payload = {
    "zone": "unblocker",
    "url": "https://www.scrapingcourse.com/ecommerce/product/adrienne-trek-jacket/",  # Replace with your target URL
    "format": "raw"
}

# Fetch the unlocked HTML of the target page
response = requests.post("https://api.brightdata.com/request", json=payload, headers=headers)
```

E assim, sem mais bloqueios, sem mais limitações! Agora você pode fazer scraping da Web usando o Gemini sem se preocupar em ser interrompido.

## Conclusão

Nesta postagem do blog, você aprendeu a usar o Gemini em combinação com o Requests e outras ferramentas para criar um raspador alimentado por IA. Um dos principais desafios da raspagem da Web é o risco de ser bloqueado, mas isso foi resolvido usando a [API Web Unlocker](/products/web-unlocker) da Bright Data.

Conforme explicado aqui, ao combinar o Gemini e a API do Web Unlocker, você pode extrair dados de qualquer site sem precisar de lógica de análise personalizada. Esse é apenas um dos muitos cenários que os produtos e serviços da Bright Data suportam, ajudando você a implementar a raspagem da Web eficaz orientada por IA.

Explore nossas outras ferramentas de raspagem da Web:

- [**Serviços de proxy**](/proxy-types): Quatro tipos diferentes de proxies para contornar restrições de localização, incluindo mais de 150 milhões de IPs residenciais
- [**APIs do Web Scraper**](/products/web-scraper): Pontos de extremidade dedicados para extrair dados da Web novos e estruturados de mais de 100 domínios populares.
- [**API SERP**](/products/serp-api): API para lidar com todo o gerenciamento de desbloqueio contínuo para SERP e extrair uma página
- [**Navegador de raspagem**](/products/scraping-browser): Navegador compatível com Puppeteer, Selenium e Playwright com atividades de desbloqueio integradas

Inscreva-se agora na Bright Data e teste nossos serviços de proxy e produtos de raspagem gratuitamente!



Contate-nosTeste grátis![google social icon](/wp-content/themes/brightdata/assets/images/ic_google.svg)









 Índice







Dedicated Scraper APIs &amp; No-Code Scrapers

Over 1000 scrapers for all popular domains. Simplify your web scraping.

[See pricing](/pricing/web-scraper "See pricing")

Just want data? Skip scraping.

Hundreds of ready-to-use datasets from all popular domains.

[See pricing](/pricing/datasets "See pricing")







 [ ](https://news.ycombinator.com/submitlink?t=Web+Scraping+com+o+Gemini+em+2026%3A+Tutorial+completo&u=https://brightdata.com.br/blog/dados-do-site/web-scraping-with-gemini) [ ](https://www.linkedin.com/shareArticle?mini=true&title=Web+Scraping+com+o+Gemini+em+2026%3A+Tutorial+completo&url=https://brightdata.com.br/blog/dados-do-site/web-scraping-with-gemini) [ ](http://www.reddit.com/submit?title=Web+Scraping+com+o+Gemini+em+2026%3A+Tutorial+completo&url=https://brightdata.com.br/blog/dados-do-site/web-scraping-with-gemini)







##  Você também pode estar interessado em

 [ ![OpenHuman with Bright Data](https://media.brightdata.com.br/2026/09/OpenHuman-with-Bright-Data.png) ](https://brightdata.com.br/blog/ai/openhuman-with-bright-data "Acesso à Web Pronto para Produção no OpenHuman Através do Bright Data CLI")

 [AI



 ![Antonello Zanini](https://media.brightdata.com.br/2022/12/Antonello-Zanini-2-50x50.jpg)

Antonello Zanini

Technical Writer





### Acesso à Web Pronto para Produção no OpenHuman Através do Bright Data CLI

Integre o Bright Data CLI ao OpenHuman para habilitar acesso à web pronto para produção e coleta de dados para agentes de IA.



 09-Sep-2026

 14 min de leitura

 ](https://brightdata.com.br/blog/ai/openhuman-with-bright-data)

 [ ![Multimodal Web Scraping with MiniMax](https://media.brightdata.com.br/2026/09/Multimodal-Web-Scraping-with-MiniMax.png) ](https://brightdata.com.br/blog/dados-do-site/multimodal-web-scraping-with-minimax "Scraping de Dados Multimodal com MiniMax")

 [Dados do site



 ![Antonello Zanini](https://media.brightdata.com.br/2022/12/Antonello-Zanini-2-50x50.jpg)

Antonello Zanini

Technical Writer





### Scraping de Dados Multimodal com MiniMax

Combine a API Web Unlocker da Bright Data com a visão MiniMax M3 para extrair dados estruturados de imagens e capturas de tela de páginas web.



 09-Sep-2026

 5 min de leitura

 ](https://brightdata.com.br/blog/dados-do-site/multimodal-web-scraping-with-minimax)

 [ ![The 10 Best CLI Tools for Codex in 2026](https://media.brightdata.com.br/2026/08/The-10-Best-CLI-Tools-for-Codex-in-2026.png) ](https://brightdata.com.br/blog/ai/best-cli-tools-for-codex "As 10 Melhores Ferramentas CLI para Codex em 2026 – Testadas & Classificadas")

 [AI



 ![Daniel Shashko](https://media.brightdata.com.br/2022/04/Daniel-Shashko-2-50x50.png)

Daniel Shashko

Web Data &amp; AI Expert





### As 10 Melhores Ferramentas CLI para Codex em 2026 – Testadas &amp; Classificadas

As 10 ferramentas CLI que tornam o Codex mais rápido e capaz, começando com o Bright Data CLI para acesso real à web de dentro do sandbox.



 06-Sep-2026

 24 min de leitura

 ](https://brightdata.com.br/blog/ai/best-cli-tools-for-codex)
