
实物拍摄 · 支持放大查看
本书深入系统地介绍了Python流行框架Scrapy的相关技术及使用技巧。全书共14章,从逻辑上可分为基础篇和篇两部分,基础篇重点介绍Scrapy的核心元素,如spider、selector、item、link等;篇讲解爬虫的话题,如登录认证、文件下载、执行Javascript、动态网页爬取、使用HTTP代理、分布式爬虫的编写等,并配合项目案例讲解,包括供练习使用的网站,以及*、知乎、豆瓣、360爬虫案例等。 本书案例丰富,注重实践,代码注释详尽,适合有一定Python语言基础,想学习编写复杂网络爬虫的读者使用。
第1章? 初识Scrapy 1
1.1? 网络爬虫是什么 1
1.2?
Scrapy简介及安装 2
1.3?个Scrapy爬虫 3
1.3.1?
项目需求 4
1.3.2?
创建项目 4
1.3.3?
分析页面 5
1.3.4?
实现Spider 6
1.3.5?
运行爬虫 8
1.4? 本章小结 11
第2章? 编写Spider 12
2.1?
Scrapy框架结构及工作原理 12
2.2?
Request和Response对象 14
2.2.1?
Request对象 15
2.2.2?
Response对象 16
2.3?
Spider开发流程 18
2.3.1?
继承scrapy.Spider 19
2.3.2?
为Spider命名 20
2.3.3?
设定起始爬取点 20
2.3.4?
实现页面解析函数 22
2.4? 本章小结 22
第3章? 使用Selector提取数据 23
3.1?
Selector对象 23
3.1.1?
创建对象 24
3.1.2?
选中数据 25
3.1.3?
提取数据 26
3.2?
Response内置Selector 28
3.3?
XPath 29
3.3.1?
基础语法 30
3.3.2?
常用函数 35
3.4?
CSS选择器 36
3.5? 本章小结 40
第4章? 使用Item封装数据 41
4.1?
Item和Field 42
4.2? 拓展Item子类 44
4.3?
Field元数据 44
4.4? 本章小结 47
第5章? 使用Item
Pipeline处理数据 48
5.1?
Item Pipeline 48
5.1.1?
实现Item Pipeline 49
5.1.2?
启用Item Pipeline 50
5.2? 更多例子 51
5.2.1?
过滤重复数据 51
5.2.2?
将数据存入
MongoDB 54
5.3? 本章小结 57
第6章? 使用linkExtractor提取链接 58
6.1? 使用linkExtractor
59
6.2? 描述提取规则 60
6.3? 本章小结 65
第7章? 使用Exporter导出数据 66
7.1? 指定如何导出数据 67
7.1.1?
命令行参数 67
7.1.2?
配置文件 69
7.2? 添加导出数据格式 70
7.2.1?
源码参考 70
7.2.2?
实现Exporter 72
7.3? 本章小结 74
第8章? 项目练习 75
8.1? 项目需求 77
8.2? 页面分析 77
8.3? 编码实现 83
8.4? 本章小结 88
第9章? 下载文件和图片 89
9.1?
FilesPipeline和
ImagesPipeline 89
9.1.1?
FilesPipeline使用
说明 90
9.1.2?
ImagesPipeline使用
说明 91
9.2? 项目实战:爬取matplotlib
例子源码文件 92
9.2.1?
项目需求 92
9.2.2?
页面分析 94
9.2.3?
编码实现 96
9.3? 项目实战:下载360图片 103
9.3.1?
项目需求 104
9.3.2?
页面分析 104
9.3.3?
编码实现 107
9.4? 本章小结 109
第10章? 模拟登录 110
10.1?
登录实质 110
10.2?
Scrapy模拟登录 114
10.2.1?
使用FormRequest 114
10.2.2?
实现登录Spider 117
10.3?
识别验证码 119
10.3.1?
OCR识别 119
10.3.2?
网络平台识别 123
10.3.3?
人工识别 127
10.4?
cookie登录 128
10.4.1?
获取浏览器
cookie 128
10.4.2?
cookiesMiddleware
源码分析 129
10.4.3?
实现Browsercookies-
Middleware 132
10.4.4?
爬取知乎个人
信息 133
10.5 ?本章小结 135
第11章? 爬取动态页面 136
11.1?
Splash渲染引擎 140
11.1.1?
render.html端点 141
11.1.2?
execute端点 142
11.2?
在Scrapy中使用Splash 145
11.3?
项目实战:爬取toscrape
中的名人名言 146
11.3.1?
项目需求 146
11.3.2?
页面分析 146
11.3.3?
编码实现 147
11.4?
项目实战:爬取京东商城
中的书籍信息 149
11.4.1?
项目需求 149
品相说明:本书为八品,书脊轻微磨损,内页整洁无涂画,无缺页少页,具体以实物照片为准。
品相标准:十品为全新未翻阅;九品近全新有轻微痕迹;八品有明显使用痕迹但内容完整;七品及以下为有破损或缺页,页面会有详细说明。
瑕疵说明:拍品图片均为实物拍摄,因显示设备差异可能存在轻微色差,以收到实物为准。
交易方式:本站采用担保交易,买家付款后资金由平台托管,确认收货无误后放款给卖家。
配送说明:下单后 48 小时内发货,默认快递发货,满 99 元包邮,多件订单可合并运费。
议价规则:标注「价格面议」的商品可通过站内消息与卖家议价,达成一致后改价下单。
七天无理由退换:收到商品七日内,若与描述不符可申请退换,运费由责任方承担。
纠纷处理:如发生交易纠纷,可提交平台介入处理,客服 09:00-18:00 在线受理。
正品保障:平台对古籍、签名本等贵重商品提供鉴定咨询服务,发现赝品全额退款。