Scrapy
Scrapy ( /ˈskreɪpaɪ/ SKRAY-peye) é um framework de web-crawling gratuito e código aberto desenvolvido em Python. Originalmente idealizado para web scraping, também pode ser utilizado para extração de dados usando APIs ou como web crawler de forma mais abrangente.[2] Atualmente é mantido pela Zyte (antiga Scrapinghub Ltd.) uma empresa de desenvolvimento e serviços relacionados a web-scraping.
| Scrapy | |
|---|---|
Scrapy | |
| Desenvolvedor | Zyte (antiga Scrapinghub) |
| Sistema operacional | Windows, macOS, Linux |
| Gênero(s) | Web crawler |
| Licença | BSD License |
A arquitetura do Scrapy é construída em torno de "spiders", que são crawlers autônomos que recebem um conjunto de instruções. Seguindo o exemplo de outros frameworks DRY (don't repeat yourself), como Django,[3] tornando mais fácil o desenvolvimento e evolução de projetos de larga escala, que utilizam o crawling, pois permite a reutilização de código. Scrapy também fornece um shell para web-crawling, que pode ser utilizado pelos desenvolvedores para testar suas suposições sobre o comportamento de um site.[4] [5] [6]
Algumas empresas, produtos e projetos bem conhecidos que usam o Scrapy são: Querido Diário[7], Lyst,[8][9] Parse.ly,[10] Sayone Technologies,[11] Sciences Po Medialab,[12] Data.gov.uk’s World Government Data site.[13]
História
Scrapy nasceu na Mydeco, empresa de agregação da web e comércio eletrônico sediada em Londres, onde foi desenvolvido e mantido por empregados da Mydeco e Insophia (uma empresa de consultoria web sediada em Montevideu, Uruguay). A primeira versão pública foi disponibilizada em Agosto de 2008 sob uma Licença BSD, e a sua versão 1.0 lançada em Junho de 2015.[14] Em 2011, Zyte (antiga Scrapinghub) tornou-se oficialmente responsável pelas manutenções do projeto.[15][16]
Referências
- «Release notes — Scrapy documentation». doc.scrapy.org (em inglês). Consultado em 18 November 2020 Verifique data em:
|acessodata=(ajuda) - Scrapy at a glance.
- «Frequently Asked Questions». Consultado em 20 janeiro 2020
- «Scrapy shell». Consultado em 20 janeiro 2020
- «Scrapy English Wikipedia». Consultado em 20 janeiro 2020
- «Scrapy Spanish Wikipedia». Consultado em 20 janeiro 2020
- «Querido Diario». queridodiario.ok.org.br. Consultado em 6 de setembro de 2021
- Bell, Eddie; Heusser, Jonathan. «Scalable Scraping Using Machine Learning». Consultado em 28 July 2015 Verifique data em:
|acessodata=(ajuda) - Scrapy | Companies using Scrapy
- Montalenti, Andrew. «Web Crawling & Metadata Extraction in Python»
- «Scrapy Companies». Scrapy website
- Hyphe v0.0.0: the first release of our new webcrawler is out!
- Ben Firshman [@bfirsh] (21 January 2010). «World Govt Data site uses Django, Solr, Haystack, Scrapy and other exciting buzzwords bit.ly/5jU3La #opendata #datastore» (Tweet) – via Twitter Verifique data em:
|data=(ajuda) - Medina, Julia (19 June 2015). «Scrapy 1.0 official release out!». scrapy-users (Lista de grupo de correio) Verifique data em:
|data=(ajuda) - Pablo Hoffman (2013). List of the primary authors & contributors. [S.l.: s.n.] Consultado em 18 November 2013 Verifique data em:
|acessodata=(ajuda) - Interview Scraping Hub.