---
title: "VLAs e Modelos de Mundo Precisam de Dados em Escala Web. Só Não os Mesmos Dados"
slug: vlas-and-world-models-need-web-scale-data
date: 2026-06-22T09:11:59+00:00
modified: 2026-09-02T12:54:14+00:00
permalink: https://brightdata.com.br/blog/lideranca/vlas-and-world-models-need-web-scale-data
type: blog
---

[ Blog ](https://brightdata.com.br/blog "Blog") / [Leadership](https://brightdata.com.br/blog/lideranca)







 [Leadership](https://brightdata.com.br/blog/lideranca)

# VLAs e Modelos de Mundo Precisam de Dados em Escala Web. Só Não os Mesmos Dados

Cinco conclusões do nosso painel de VLA: por que pré-treinamento em escala web, velocidade de curadoria e proveniência de dados definem a corrida para construir robôs no mundo real.

 11 min de leitura





 [ ![](https://media.brightdata.com.br/2026/06/image-40-50x50.png) ](https://brightdata.com/blog/authors/adam-chan)

 [Adam Chan

Founder &amp; Builder @Hackersquad

 ](https://brightdata.com/blog/authors/adam-chan)





 ![](https://media.brightdata.com.br/2026/06/2_VLAs-and-World-Models-Need-Web-Scale-Data.-Just-Not-the-Same-Data.png)





Um resumo da noite de VLA no web data loft.

Reunimos engenheiros da Agility Robotics, Tesla, Prometheus e Distill Labs no [Web Data Loft da Bright Data](https://brightdata.com/) em São Francisco para discutir uma pergunta:

**O que realmente é necessário para passar de um modelo de linguagem para um robô que funciona no mundo real?**

A resposta foi mais concreta do que o hype sugere. O gargalo não é apenas a arquitetura do modelo. É o corpus de treinamento: o que você coleta, como você combina, de onde vem, e se você consegue curá-lo em uma escala que nenhuma equipe manual consegue igualar.

No painel estavam Sri e Ahmed da Agility Robotics, Ankur, engenheiro de ML em robótica falando em capacidade pessoal, Daniel da Prometheus, ex-1X e Waymo, e Jacek, cofundador da Distill Labs. A conversa foi moderada por Adam do HackerSquad e do Builders Collective.

Abaixo estão os cinco pontos principais que importam se você está construindo um modelo Vision-Language-Action, um modelo de mundo, ou o pipeline de dados por trás de um.

## 1. Um VLA é um VLM com um cabeçalho de ação, e sua generalização vem do pré-treinamento em escala web

A definição de trabalho do painel era simples: um VLA começa como um modelo de visão-linguagem treinado em texto e imagens em escala da internet, em tarefas como legendagem, segmentação e compreensão de objetos. Você então adiciona um componente de ação e o ajusta em dados robóticos.

Essa distinção importa. Os dados do robô ensinam a execução. O pré-treinamento em escala web ensina ao modelo o que é o mundo.

É por isso que um VLA às vezes consegue pegar um objeto para o qual nunca foi explicitamente treinado. A generalização não vem apenas de um pequeno conjunto de demonstrações de robô teleoperado. Ela vem de uma ampla exposição visual e semântica antes do robô entrar no ciclo.

Se o seu [corpus de pré-treinamento](https://brightdata.com/use-cases/training-data) for restrito, nenhuma quantidade de dados caros de teleoperação recupera totalmente a generalização que você ignorou.

> *“É treinado em dados de texto e imagens em escala da internet… depois você ajusta o VLM em dados robóticos e obtém um modelo visão-linguagem-ação. O bom é que tem melhor generalização: se você o treina para pegar um objeto, pode pedir que pegue um objeto diferente, porque já viu coisas similares.”*
> — **Ankur**, engenheiro de ML em robótica, falando em capacidade pessoal. [Assistir em 9:59 →](https://www.youtube.com/watch?v=8w446Aa6FWM&t=599s)

📖 *Leitura relacionada:* [O que é um Modelo de Visão-Linguagem (VLA)?](https://brightdata.com/ai/video-data/vla) · [Melhores Bibliotecas de IA para Robótica](https://brightdata.com/blog/ai/best-robotics-ai-libraries) · [Modelos de Fundação explicados](https://brightdata.com/glossary/foundation-model)

## 2. Visão, linguagem e ação estão convergindo para um único espaço de tokens

Os VLAs modernos se parecem cada vez mais com LLMs em um aspecto importante: eles preveem o próximo token.

Esse token pode ser uma palavra, um patch de imagem ou um comando de controle no espaço de juntas. Como Jacek, cofundador da Distill Labs, explicou, a conexão com agentes de software é direta. Um LLM chama ferramentas via API. Um VLA chama ferramentas físicas. O mecanismo muda de “chamar um endpoint” para “pegar o copo”, mas o padrão subjacente é semelhante.

A implicação é poderosa: toda modalidade que pode ser tokenizada pode se tornar parte do mesmo espaço de treinamento. Vídeo da web, filmagens egocêntricas, demonstrações humanas, teleoperação e dados de robô on-policy podem contribuir para uma representação compartilhada.

A restrição então passa de “o modelo consegue usar isso?” para “conseguimos obter os exemplos certos na escala certa?”

> *“Você pode pensar no seu espaço de ação como chamada de função para LLMs… você divide assim e não é diferente do que as pessoas constroem para o mundo não físico, agentes que ativam subagentes em um mecanismo que expõe ferramentas. Agora o mecanismo é mais físico. Isso o torna poderoso, porque você pode contar com dados de treinamento da web para obter um bom ponto de partida.”*
> — **Jacek**, cofundador, Distill Labs. [Assistir em 15:14 →](https://www.youtube.com/watch?v=8w446Aa6FWM&t=914s)

📖 *Leitura relacionada:* [Tokenização explicada](https://brightdata.com/glossary/tokenization) · [Dentro da Stack de Tecnologia de Agentes de IA](https://brightdata.com/blog/ai/ai-agent-tech-stack) · [Como Construir Agentes de IA: Roteiro Completo](https://brightdata.com/blog/ai/ai-agents-roadmap)

## 3. VLAs e modelos de mundo precisam de dados diferentes, confundir os dois é custoso

Uma das distinções mais marcantes da noite foi entre o treinamento de VLA e o treinamento de modelo de mundo.

Como Ankur enquadrou, um VLA é basicamente um **problema de aprendizado por imitação**. Você quer trajetórias limpas, bem-sucedidas e de alta qualidade. Demonstrações ruins podem prejudicar.

Um **modelo de mundo** é diferente. Ele precisa prever o que acontece a seguir dada uma ação, o que significa que precisa entender não apenas resultados bem-sucedidos, mas também erros, casos extremos e falhas. Se você quiser usar um modelo de mundo para planejamento ou como simulador aprendido para [aprendizado por reforço](https://brightdata.com/glossary/reinforcement-learning), ele precisa representar toda a gama de futuros possíveis.

Daniel, engenheiro na Prometheus que anteriormente liderou trabalhos com modelos de mundo na 1X, explicou por que isso é difícil. Muitos modelos de mundo atuais são tendenciosos para resultados bem-sucedidos. Quando mostrados uma trajetória prestes a falhar, podem aluci­nar uma recuperação em vez de modelar o erro. Na robótica, isso é especialmente perigoso. O modelo deve ser controlável por ação precisamente nos momentos em que contato, preensão e falha são mais prováveis.

A conclusão: “dados de robótica” não é um balde genérico único. Políticas de imitação e modelos de mundo exigem corpus deliberadamente diferentes.

> *“Você realmente quer um modelo de mundo que seja muito controlável por ação… o momento decisivo quando você está agarrando um objeto. Se houver lacunas aí, é um sinal muito ruim.”*
> — **Daniel**, Prometheus, ex-1X. [Assistir em 35:36 →](https://www.youtube.com/watch?v=8w446Aa6FWM&t=2136s)

📖 *Leitura relacionada:* [O que é Treinamento de Modelo de IA?](https://brightdata.com/blog/ai/what-is-ai-model-training) · [Alucinação de IA explicada](https://brightdata.com/glossary/ai-hallucination) · [Conjuntos de dados de robótica](https://brightdata.com/products/datasets/robotics)

## 4. A hierarquia de dados é real: dados da web dão amplitude, dados de robô dão controle

Ahmed, engenheiro na Agility Robotics, apresentou uma hierarquia clara de sinal.

Os dados de teleoperação contêm a informação de controle mais forte porque incluem o estado completo do robô. Demonstrações humanas e vídeos egocêntricos carregam menos sinal de controle direto. Vídeos da web carregam o mínimo na camada de controle de baixo nível.

Mas isso não torna os [dados da web](https://brightdata.com/products/datasets) menos importantes. Torna seu papel diferente.

O vídeo em escala web ensina semântica, contexto, estrutura de tarefas, diversidade de objetos e conhecimento geral do mundo. Ajuda o modelo a entender como salas, ferramentas, pessoas, objetos e metas aparecem em enorme variação. O que não ensina bem é a física refinada de um corpo robótico específico executando uma ação específica.

Ankur deu a analogia mais clara: você pode assistir a todos os vídeos de Messi ou Ronaldo já gravados e entender profundamente o futebol, mas ainda não consegue jogar sem praticar. Os dados da web ensinam o jogo. Os dados no robô ensinam o corpo.

O insight prático sobre orçamento de dados veio da mesma troca: **uma hora de dados da web pode fornecer aproximadamente o valor transferível de cinco minutos de dados de teleoperação**. Os dados da web não substituem a teleop, mas um forte pré-treinamento em escala web pode reduzir a quantidade de dados caros de robô que você precisa para alcançar execução confiável.

> *“Podemos assistir muitos vídeos de futebol do Messi ou Ronaldo, mas até praticarmos nós mesmos não conseguimos realmente jogar. A compreensão da tarefa obtemos dos dados da web. Para realmente executá-la, precisamos de dados no robô… talvez uma hora de dados da web equivalha a cinco minutos de dados de teleop.”*
> — **Ankur**, engenheiro de ML em robótica, falando em capacidade pessoal. [Assistir em 1:01:09 →](https://www.youtube.com/watch?v=8w446Aa6FWM&t=3669s)

📖 *Leitura relacionada:* [Dados para IA em vídeo](https://brightdata.com/ai/video-data) · [Conjunto de dados de Vídeos do YouTube](https://brightdata.com/products/datasets/youtube/videos) · [Conjuntos de Dados de Áudio para IA](https://brightdata.com/products/datasets/audio) · [Conjuntos de Dados de Imagem](https://brightdata.com/products/datasets/image)

## 5. Ainda não há leis de escalonamento confiáveis, então a velocidade de curadoria se torna a vantagem

Para LLMs, o setor tem as leis de escalonamento de Kaplan e Chinchilla. Para VLAs e modelos de mundo, Daniel foi direto: a robótica ainda não chegou lá.

As equipes ainda não conseguem prever de forma confiável o desempenho do robô como uma função clara de tokens da web, horas de teleop, dados de implantação, computação ou tamanho do modelo. Parte do desafio é que o aprendizado por imitação e a modelagem de mundo usam sinais de supervisão diferentes. Outro é que a métrica que importa é o sucesso da tarefa downstream, não a perda de pré-treinamento.

Daniel também traçou um contraste útil com a simulação de veículos autônomos. Na direção autônoma, a simulação muitas vezes para quando ocorre contato. Na robótica, o contato é onde a complexidade real começa. Agarrar, empurrar, escorregar, deformar, colidir e recuperar não são casos extremos. São a tarefa.

Até que leis de escalonamento melhores surjam, a vantagem vai para as equipes que conseguem encontrar e curar os exemplos certos mais rapidamente: cenas específicas, famílias de tarefas, interações com objetos, falhas e momentos ricos em contato. Isso não é apenas um desafio de modelagem. É um desafio de descoberta e [pipeline de dados](https://brightdata.com/blog/proxy-101/data-pipeline-architecture).

> *“Responder leis de escalonamento em relação a contagens de flops ou tokens agora é comum para LLMs, Kaplan et al., as leis de escalonamento Chinchilla. Não estamos realmente fazendo essas perguntas para comparar cientificamente VLAs e modelos de mundo hoje… Acho que a resposta é que ainda não chegamos lá, e realmente deveríamos chegar.”*
> — **Daniel**, Prometheus, ex-1X e Waymo. [Assistir em 54:35 →](https://www.youtube.com/watch?v=8w446Aa6FWM&t=3275s)

📖 *Leitura relacionada:* [Descoberta de Dados](https://brightdata.com/blog/web-data/data-discovery) · [Melhores Provedores de Dados de Treinamento de IA](https://brightdata.com/blog/ai/best-ai-training-data-providers) · [Dados de Treinamento para LLM](https://brightdata.com/blog/web-data/llm-training-data)

## O que isso significa para sua estratégia de dados em robótica

O painel convergiu para uma conclusão clara:

> **Dados em escala web dão aos robôs uma ampla compreensão do mundo. Dados no robô ensinam como agir nele. Quanto melhor seu corpus de pré-treinamento, menos dados caros de robô você precisa para alcançar execução confiável.**

Agir com base nisso requer três capacidades que a maioria das equipes subestima:

### 🌐 Extração em escala web

Coleta de vídeo, imagem e áudio em escala de petabytes da web aberta, não apenas conjuntos de dados acadêmicos congelados com taxonomias desatualizadas. Veja a [infraestrutura de coleta de dados em escala web da Bright Data](https://brightdata.com/products/web-scraper) e as [soluções de dados personalizadas](https://brightdata.com/products/data-solutions).

### 🔍 Descoberta visual além da busca por palavras-chave

A diversidade de tarefas mais valiosa frequentemente aparece em cenas que nunca são descritas em um título, tag ou legenda. A busca por palavras-chave perde grande parte da cauda longa.

### ⚖️ Proveniência defensável

Modelos de texto treinam em trilhões de tokens. VLAs treinam em trilhões de frames. Cada frame pode carregar uma questão de licenciamento e proveniência, e a implantação de robôs no mundo real eleva as apostas. Saiba mais em nosso [Centro de Confiança](https://brightdata.com/trustcenter) e em nossas [diretrizes de coleta ética de dados](https://brightdata.com/trustcenter/privacy-ethical-data-collection-guidelines).

Os modelos estão convergindo. O diferencial está se tornando o corpus: **quão amplo ele é, quão relevante é, e se você consegue defender de onde veio.**

### Construindo um VLA ou modelo de mundo?

[**Fale com nossa equipe →**](https://brightdata.com/contact) sobre descoberta e obtenção de vídeos de treinamento em escala web.

Saiba mais sobre a [Bright Data para IA](https://brightdata.com/ai), explore nossa [oferta de dados em vídeo para VLAs](https://brightdata.com/ai/video-data/vla), ou navegue pelos nossos [conjuntos de dados prontos](https://brightdata.com/products/datasets) para robótica, visão computacional e treinamento multimodal.



Contate-nosTeste grátis![google social icon](/wp-content/themes/brightdata/assets/images/ic_google.svg)









 Índice













 [ ](https://news.ycombinator.com/submitlink?t=VLAs+e+Modelos+de+Mundo+Precisam+de+Dados+em+Escala+Web.+S%C3%B3+N%C3%A3o+os+Mesmos+Dados&u=https://brightdata.com.br/blog/lideranca/vlas-and-world-models-need-web-scale-data) [ ](https://www.linkedin.com/shareArticle?mini=true&title=VLAs+e+Modelos+de+Mundo+Precisam+de+Dados+em+Escala+Web.+S%C3%B3+N%C3%A3o+os+Mesmos+Dados&url=https://brightdata.com.br/blog/lideranca/vlas-and-world-models-need-web-scale-data) [ ](http://www.reddit.com/submit?title=VLAs+e+Modelos+de+Mundo+Precisam+de+Dados+em+Escala+Web.+S%C3%B3+N%C3%A3o+os+Mesmos+Dados&url=https://brightdata.com.br/blog/lideranca/vlas-and-world-models-need-web-scale-data)







##  Você também pode estar interessado em

 [ ![Best LLM Scrapers blog image](https://media.brightdata.com.br/2026/02/Best-LLM-Scrapers.png) ](https://brightdata.com.br/blog/ai/best-llm-scrapers "Os melhores scrapers LLM em 2026: a comparação definitiva de ferramentas")

 [AI



 ![Antonello Zanini](https://media.brightdata.com.br/2022/12/Antonello-Zanini-2-50x50.jpg)

Antonello Zanini

Technical Writer





### Os melhores scrapers LLM em 2026: a comparação definitiva de ferramentas

Uma comparação lado a lado dos 6 principais Scrapers LLM em 2026, cobrindo modelos compatíveis, preços e principais recursos para ajudá-lo a escolher a ferramenta certa.



 24-Feb-2026

 20 min de leitura

 ](https://brightdata.com.br/blog/ai/best-llm-scrapers)

 [ ![Best Robotics AI Libraries](https://media.brightdata.com.br/2026/02/Best-Robotics-AI-Libraries.png) ](https://brightdata.com.br/blog/ai/best-robotics-ai-libraries "Melhores bibliotecas de IA para robótica em 2026: as 10 melhores opções")

 [AI



 ![Antonello Zanini](https://media.brightdata.com.br/2022/12/Antonello-Zanini-2-50x50.jpg)

Antonello Zanini

Technical Writer





### Melhores bibliotecas de IA para robótica em 2026: as 10 melhores opções

Explore as melhores bibliotecas de IA robótica em 2026, da NVIDIA Isaac à LeRobot, com comparações detalhadas para ajudá-lo a escolher a solução certa.



 11-Feb-2026

 22 min de leitura

 ](https://brightdata.com.br/blog/ai/best-robotics-ai-libraries)

 [ ![Building AI-Ready Vector Datasets for LLMs blog image](https://media.brightdata.com.br/2025/05/Building-AI-Ready-Vector-Datasets-for-LLMs.svg) ](https://brightdata.com.br/blog/ai/ai-ready-vector-datasets "Criando conjuntos de dados vetoriais prontos para IA para LLMs: Um guia com Bright Data, Google Gemini e Pinecone")

 [AI



 ![Satyam Tripathi](https://media.brightdata.com.br/2024/09/Satyam-Tripathi-50x50.png)

Satyam Tripathi

Technical Writer





### Criando conjuntos de dados vetoriais prontos para IA para LLMs: Um guia com Bright Data, Google Gemini e Pinecone

Os modelos de linguagem ampla (LLMs) estão transformando a forma como acessamos informações e criamos aplicativos inteligentes. Para aproveitar todo o seu potencial, especialmente com conhecimento específico do domínio ou dados proprietários, é fundamental criar conjuntos de dados vetoriais estruturados e de alta qualidade. O desempenho e a precisão de um LLM estão diretamente ligados […]



 14-May-2025

 23 min de leitura

 ](https://brightdata.com.br/blog/ai/ai-ready-vector-datasets)
