Resumo: O GoSpider é um rastreador de linha de comandos destinado a descobrir URLs, não um extrator completo de dados estruturados. Este guia sobre como utilizar o GoSpider demonstra um rastreio limitado, um tratamento adequado dos resultados, uma transferência do Colly para CSV e um procedimento de diagnóstico para respostas 403 ou páginas que requerem renderização em JavaScript.
O rastreio da Web consiste na descoberta e percurso automatizados de páginas Web através dos seus links. O GoSpider é um rastreador de linha de comandos baseado em Go que mapeia URLs rapidamente, enquanto um extrator como o Colly visita as páginas selecionadas e extrai campos para um esquema utilizável.
Se procurou por «Como utilizar o GoSpider», a distinção mais importante é o ponto de transferência: o GoSpider constrói o conjunto de URLs candidatas e, em seguida, o seu código de limpeza e extração decide o que se torna dados. Essa separação mantém a descoberta suficientemente ampla para encontrar páginas úteis, sem a misturar com seletores, validação de registos ou gravação em CSV.
Este tutorial começa com um pequeno site de teste público, explica os comandos do GoSpider que controlam o âmbito e a carga e, em seguida, transforma o resultado numa pipeline Go reproduzível. Também trata os sinalizadores e os valores predefinidos como sensíveis à versão. Antes de executar qualquer receita, compare-a com gospider -h e o repositório oficial do GoSpider, pois os aliases e o comportamento podem mudar entre versões.




