Scrapy 资源

后端网页提取的生产级生态系统

实用插件

scrapy-playwright

浏览器渲染

用于处理 JavaScript 站点和动态内容的现代标准,并遵循常规的 Scrapy 工作流程。

探索浏览器渲染→
spidermon

监控

一个为 Scrapy 爬虫添加监控、验证和告警(Slack/Discord/电子邮件)功能的框架。

探索监控→
scrapy-zyte-api

反封锁

连接到 Zyte 的托管 API,实现自动代理轮换、浏览器指纹识别和防封锁。

探索反封锁 →
scrapy-poet

页面对象 (Page objects)

将提取逻辑与爬虫中的解析逻辑分离。另请参阅 网页抓取副驾驶 (VS Code 插件) 以进行代码生成。

探索页面对象→

部署选项

Scrapyd

自托管

允许您上传 Scrapy 项目并通过 JSON API 控制其中的爬虫。

阅读更多→
Scrapy Cloud by Zyte

托管云服务

快速简便的部署,提供免费层级。完全托管的扩缩容、日志记录和存储。

免费试用→

知识库