Extrair dados de site para Excel com um pedido em português
Você achou um diretório, catálogo ou página de anúncios com exatamente os dados que precisa, mas copiar linha por linha levaria a tarde toda. Com este prompt, seu agente do todo.is abre o site em um navegador de verdade, passa pelas páginas, extrai os campos que você pediu e entrega um Excel organizado, uma linha por item e o link de origem em cada uma.
O prompt
- Extraia os dados de [SITE OU LINK DA PÁGINA] para um arquivo Excel. Para cada item da página, colete estas colunas: [COLUNAS QUE VOCÊ QUER]. Siga os links de "próxima página" e pare depois de [QUANTAS PÁGINAS OU ITENS]. Abra a página de detalhe de um item só se alguma coluna não estiver na listagem. Inclua uma coluna "URL de origem" em cada linha. Limpe os dados: tire espaços extras, deixe os preços como número com uma coluna separada para a moeda, use um só formato de data (DD/MM/AAAA) e deixe a célula vazia em vez de chutar. Remova duplicatas exatas. Salve como [NOME DO ARQUIVO].xlsx com o cabeçalho congelado e filtros ativos, mais uma segunda aba com as páginas que não conseguiu ler e o motivo. Use só páginas públicas e respeite os termos do site e o robots.txt.
O que mudar
- [SITE OU LINK DA PÁGINA]: A página pública onde a lista começa, por exemplo uma categoria de loja, o resultado de busca de um diretório ou uma agenda de eventos.
- [COLUNAS QUE VOCÊ QUER]: Por exemplo "nome, preço, nota, número de avaliações, marca" ou "empresa, cidade, telefone, site".
- [QUANTAS PÁGINAS OU ITENS]: Por exemplo "10 páginas" ou "300 itens". Comece pequeno para conferir o resultado.
- [NOME DO ARQUIVO]: Por exemplo "Moedores_Cafe_Out". O agente acrescenta o .xlsx.
Exemplo de resultado
- Moedores_Cafe_Out.xlsx
- Origem: página pública da categoria "Moedores de café" de uma loja de utilidades (exemplo) · 12 páginas lidas · 286 linhas
- Aba 1: Dados (primeiras linhas)
- • Nome: Moedor Burrline Pro 40 · Marca: Burrline · Preço: 1189,00 · Moeda: BRL · Nota: 4,6 · Avaliações: 412 · URL de origem: /p/burrline-pro-40
- • Nome: Moedor Manual Mokka · Marca: Mokka · Preço: 259,90 · Moeda: BRL · Nota: 4,3 · Avaliações: 88 · URL de origem: /p/mokka-manual
- • Nome: Moedor Steelmill S2 · Marca: Steelmill · Preço: 749,00 · Moeda: BRL · Nota: (vazio, ainda sem avaliações) · Avaliações: 0 · URL de origem: /p/steelmill-s2
- Como o arquivo está montado
- • Cabeçalho congelado e filtro em todas as colunas
- • Preço e nota gravados como número, para ordenar e usar SOMA ou MÉDIA
- • Moeda em uma coluna própria, sem misturar com o texto do preço
- • 9 duplicatas exatas removidas (o mesmo produto aparecendo em dois lugares)
- Aba 2: Não coletado
- • Página 7, item "Grindmaster Duo": a página de detalhe deu erro, tentei de novo uma vez
- • Página 11, item "Kit promocional": sem preço na página, deixado vazio
- Observações
- • O robots.txt do site permite as páginas de categoria. Fiz pausas entre as páginas para não sobrecarregar o site.
- • Os preços são os que a página mostrava em 08/10. Quando havia preço promocional, ele foi usado, e o preço cheio ficou em outra coluna.
- • Preço à vista e parcelado aparecem em colunas separadas quando a loja mostra os dois.
- Quer isso toda semana? Diga "rode toda segunda às 7h e me mande só as linhas novas ou alteradas".
Como fazer com o todo.is
- Copie o prompt e preencha o link da página, as colunas e quanto coletar.
- Cole na tela Hoje do todo.is ou mande para o seu agente pelo WhatsApp ou Telegram.
- Seu agente navega pelas páginas, coleta os campos e confere os dados antes de montar o arquivo.
- Baixe o .xlsx, compare algumas linhas com o site e depois peça colunas extras ou uma rodada semanal.
Dicas para um resultado melhor
- Escreva o nome das colunas exatamente como quer no cabeçalho. Evita renomear depois.
- Faça primeiro um teste pequeno (uma ou duas páginas), confira e só então peça a extração completa.
- Para páginas que só aparecem com login, conecte o seu Chrome com o Connector do todo.is e colete só dados que você tem direito de usar.
- Peça uma coluna "Coletado em" se for comparar rodadas ao longo do tempo.
- Se o site oferece exportação oficial ou API, use. É mais confiável do que extrair da página.
extrair dados de site para Excel: perguntas frequentes
- É legal extrair dados de um site para o Excel? Coletar dados públicos para uso próprio é comum, mas as regras dependem dos termos do site, do país e do tipo de dado. Evite dados pessoais, que no Brasil são protegidos pela LGPD, e leia os termos antes de reutilizar ou publicar.
- Funciona em páginas que carregam com JavaScript ou rolagem infinita? Sim. O agente usa um navegador de verdade, então rola a página e espera o conteúdo carregar como um visitante faria.
- Quantas linhas consigo extrair? Milhares funcionam bem na maioria dos sites, mas rodadas maiores demoram mais e usam mais créditos. Comece com poucas páginas e aumente.
- Posso receber em CSV ou Google Planilhas? Sim. Peça CSV, ou peça para o agente colocar no Google Planilhas se a sua conta Google estiver conectada.
JavaScript is required to use the todo.is app.