Saltar para o conteúdo

Blog

Perspetivas e Engenharia

Análises aprofundadas sobre a infraestrutura de dados da Web, técnicas de extração e o futuro dos dados estruturados em grande escala.

Artigos mais recentes

181 artigos

Como usar um proxy no Node-Fetch: Um Guia Prático
Guias

Como usar um proxy no Node-Fetch: Um Guia Prático

TL;DR: O Node-Fetch não tem um switch de proxy embutido, então você conecta um agente HTTP, HTTPS ou SOCKS5 na requisição através de sua opção de agente. Este guia mostra como usar um proxy no Node-Fetch de ponta a ponta: proxies HTTP e HTTPS autenticados, SOCKS5, rotação, novas tentativas, casos extremos de TLS, solução de problemas e a rota moderna undici para o fetch nativo do Node 18+.

Mihnea-Octavian Manolache13 min read
Ler artigo
Web Scraping de Tabelas JavaScript em Python: De APIs ocultas a Playwright
Guias

Web Scraping de Tabelas JavaScript em Python: De APIs ocultas a Playwright

TL;DR: Web scraping de tabelas JavaScript em Python raramente precisa de um navegador sem cabeça. Abra o DevTools, encontre o endpoint JSON que hidrata a grade, reproduza-o com solicitações, pagine-o e volte para o Playwright apenas quando a chamada de rede for assinada, criptografada ou fechada de outra forma.

Andrei Ogiolan13 min read
Ler artigo
Como extrair tabelas HTML em Golang com Colly: Guia de ponta a ponta
Guias

Como extrair tabelas HTML em Golang com Colly: Guia de ponta a ponta

TL;DR: Este guia mostra como extrair tabelas HTML em Golang de ponta a ponta: escolha entre Colly, goquery e golang.org/x/net/html, direcione o <tbody> correto, modele as linhas como uma estrutura tipada e exporte JSON e CSV limpos. Você também obtém paginação, anti-bloqueio e padrões de tabela renderizados em JavaScript.

Andrei Ogiolan11 min read
Ler artigo
Playwright Web Scraping: O Guia Completo para Python e Node.js
Guias

Playwright Web Scraping: O Guia Completo para Python e Node.js

TL;DR: O Playwright oferece automação completa do navegador para raspagem de sites com muito JavaScript, com suporte de primeira classe para Python e Node.js. Este guia o orienta na instalação, extração de elementos, configuração de proxy, anti-deteção, paginação, downloads de imagens e exportação de dados para CSV ou JSON, tudo com exemplos de código lado a lado em ambas as linguagens.

Mihnea-Octavian Manolache16 min read
Ler artigo
Como extrair comentários do Google Maps: Um Guia Prático em Python
Guias

Como extrair comentários do Google Maps: Um Guia Prático em Python

TL;DR: Descobrir como fazer scraping de reviews do Google Maps se resume a três métodos: um scraper Selenium DIY por trás de um proxy rotativo, uma API de scraping com instruções de renderização ou uma API de Reviews do Maps estruturada que retorna JSON analisado. Este guia percorre os três métodos em Python com código que pode ser copiado e colado, padrões de paginação, tácticas anti-bloqueio e um passo final de limpeza que transforma os comentários em bruto em algo que uma empresa pode realmente usar.

Andrei Ogiolan17 min read
Ler artigo
Descarregue páginas da Web e ficheiros com facilidade usando Python e o wget
Guias

Descarregue páginas da Web e ficheiros com facilidade usando Python e o wget

Automatize a extração de dados da Web e o download de ficheiros com Python e o wget. Aprenda a utilizar estas ferramentas para recolher dados e poupar tempo.

Gabriel Cioci8 min read
Ler artigo

Comece a construir

Pronto para expandir a sua recolha de dados?

Junte-se a mais de 2.000 empresas que utilizam a WebScrapingAPI para extrair dados da Web à escala empresarial, sem quaisquer custos de infraestrutura.