Saltar para o conteúdo

Blog

Perspetivas e Engenharia

Análises aprofundadas sobre a infraestrutura de dados da Web, técnicas de extração e o futuro dos dados estruturados em grande escala.

Artigos mais recentes

181 artigos

Como criar um rastreador da Web usando Python - Guia para principiantes
Guias

Como criar um rastreador da Web usando Python - Guia para principiantes

Este tutorial irá demonstrar como rastrear a Web utilizando Python. O rastreamento da Web é uma abordagem eficaz para recolher dados da Web, localizando todos os URLs de um ou mais domínios.

Ștefan Răcilă8 min read
Ler artigo
Como extrair tabelas HTML usando Python
Guias

Como extrair tabelas HTML usando Python

TL;DR: A maioria das tabelas HTML pode ser raspada com uma única linha de pandas.read_html. Quando a tabela é paginada, renderizada em JavaScript ou tem cabeçalhos mesclados, mude para Requests + BeautifulSoup ou um navegador sem cabeçalho como o Playwright. Este guia fornece uma matriz de decisão, código de trabalho para todas as três abordagens e as etapas de limpeza que transformam as linhas raspadas em dados prontos para o pipeline.

Andrei Ogiolan17 min read
Ler artigo
Cheerio vs Puppeteer: Como escolher a ferramenta certa
Guias

Cheerio vs Puppeteer: Como escolher a ferramenta certa

TL;DR: Cheerio é um analisador de HTML leve; Puppeteer conduz um navegador Chromium real. Use o Cheerio quando os dados já estiverem no HTML bruto, o Puppeteer quando o JavaScript os renderizar, e combine-os quando uma página com muito JS tiver muitos campos para extrair por visita.

Sergiu Inizian9 min read
Ler artigo
O que é a automatização do navegador? Um guia prático
A ciência da extração de dados da Web

O que é a automatização do navegador? Um guia prático

TL;DR: A automação do navegador é a prática de conduzir um navegador da Web real ou sem cabeça a partir do código para que ele clique, digite, navegue e leia páginas em seu nome. Este guia explica o que é automação de navegador nos bastidores, compara Selenium, Playwright, Puppeteer e Cypress, e mostra quando não se deve usar um navegador completo.

Ștefan Răcilă13 min read
Ler artigo
Web Scraping vs Data Mining: Diferenças, pipelines e quando usar cada um
A ciência da extração de dados da Web

Web Scraping vs Data Mining: Diferenças, pipelines e quando usar cada um

TL;DR: O Web scraping recolhe dados em bruto de páginas Web públicas. A extração de dados analisa dados estruturados para obter padrões, previsões e segmentos. São fases diferentes do mesmo ciclo de vida e a maioria dos sistemas de produção combinam-nas num pipeline de scrape-then-normalize-then-mine.

Ștefan Răcilă15 min read
Ler artigo
Melhores cursos de Web Scraping para desenvolvedores
A ciência da extração de dados da Web

Melhores cursos de Web Scraping para desenvolvedores

TL;DR: Os melhores cursos de web scraping dependem do seu idioma, nível e caso de uso alvo. Este guia compara cinco opções pagas na Udemy, Coursera, DataCamp e Packt, aponta para suplementos gratuitos, como documentos oficiais, e mostra como fazer a ponte entre a conclusão de um curso e a execução de scrapers de produção.

Ștefan Răcilă12 min read
Ler artigo

Comece a construir

Pronto para expandir a sua recolha de dados?

Junte-se a mais de 2.000 empresas que utilizam a WebScrapingAPI para extrair dados da Web à escala empresarial, sem quaisquer custos de infraestrutura.