Python网络爬虫权威指南(第2版)

作者: [美]瑞安•米切尔 | 译者: 神烦小宝
 评分: 7.5   分类: 爬虫 

本书采用简洁强大的Python语言,全面介绍网页抓取技术,解答诸多常见问题,是掌握从数据爬取到数据清洗全流程的系统实践指南。书中内容分为两部分。第一部分深入讲解网页抓取的基础知识,重点介绍BeautifulSoup、Scrapy等Python库的应用。第二部分介绍网络爬虫编写相关的主题,以及各种数据抓取工具和应用程序,帮你深入互联网的每个角落,分析原始数据,获取数据背后的故事,轻松解决遇到的各类网页抓取问题。第2版全面更新,新增网络爬虫模型、Scrapy和并行网页抓取相关章节。

- 解析复杂的HTML页面

- 使用Scrapy框架开发爬虫

- 学习存储数据的方法

- 从文档中读取和提取数据

- 清洗格式糟糕的数据

- 自然语言处理

- 通过表单和登录窗口抓取数据

- 抓取JavaScript及利用API抓取数据

- 图像识别与文字处理

- 避免抓取陷阱和反爬虫策略

- 使用爬虫测试网站

出版社: 人民邮电出版社
豆瓣链接: 点击访问
出版年: 2019-4
资源提供: root
页数: 260
文件大小: 9.66MB
ISBN: 9787115509260
下载次数: 91

Copyright © 2024.Copyright Itbox All Rights Reserved.
免责声明:本站所有的书籍资源皆收集于互联网,仅供学习交流,严禁用于商业用途,并请于下载后24小时内删除。 若发布的内容侵犯到您的权益,请及时联系邮箱mcystory@126.com,我们将在第一时间处理。