简易数据分析 13 | Web Scraper 抓取二级页面（详情页）

优采云发布时间: 2022-06-23 18:04

　　如果做到这一步，其实已经可以抓到所有已知的列表数据了，但本文的重点是：如何抓取二级页面（详情页）的三连数据？

　　跟着做了这么多爬虫，可能你已经发现了，Web Scraper 本质是模拟人类的操作以达到抓取数据的目的。

　　那么我们正常查看二级页面（详情页）是怎么操作的呢？其实就是点击标题链接跳转：

　　Web Scraper 为我们提供了点击链接跳转的功能，那就是 Type 为 Link 的选择器。

　　感觉有些抽象？我们对照例子来理解一下。

　　首先在这个案例里，我们获取了标题的文字，这时的选择器类型为 Text：

　　当我们要抓取链接时，就要再创建一个选择器，选的元素是一样的，但是 Type 类型为 Link：

　　创建成功后，我们点击这个 Link 类型的选择器，进入他的内部，再创建相关的选择器，下面我录了个动图，注意看我鼠标强调的导航路由部分，可以很清晰的看出这几个选择器的层级关系：

　　4.创建详情页子选择器

　　当你点击链接后就会发现，浏览器会在一个新的 Tab 页打开详情页，但是 Web Scraper 的选择窗口开在列表页，无法跨页面选择想要的数据。

　　处理这个问题也很简单，你可以复制详情页的链接，拷贝到列表页所在的 Tab 页里，然后回车重新加载，这样就可以在当前页面选择了。

　　我们在类型为 Link 的选择器内部多创建几个选择器，这里我选择了点赞数、*敏*感*词*数、收藏数和分享数 4 个数据，这个操作也很简单，这里我就不详细说了。

　　所有选择器的*敏*感*词*如下：

　　我们可以看到 video_detail_link 这个节点包含 4 个二级页面（详情页）的数据，到此为止，我们的子选择器已经全部建立好了。

　　5.抓取数据

　　终于到了激动人心的环节了，我们要开始抓取数据了。但是抓取前我们要把等待时间调整得大一些，默认时间是 2000 ms，我这里改成了 5000 ms。

　　为什么这么做？看了下图你就明白了：

　　首先，每次打开二级页面，都是一个全新的页面，这时候浏览器加载网页需要花费时间；

　　其次，我们可以观察一下要抓取的点赞量等数据，页面刚刚加载的时候，它的值是「--」，等待一会儿后才会变成数字。

　　所以，我们直接等待 5000 ms，等页面和数据加载完成后，再统一抓取。

　　配置好参数后，我们就可以正式抓取并下载了。下图是我抓取数据的一部分，特此证明此方法有用：

　　6.总结

　　这次的教程可能有些难度，我把我的 SiteMap 分享出来，制作的时候如果遇到难题，可以参考一下我的配置，SiteMap 导入的功能我在里详细说明了，大家可以配合食用：

　　{"_id":"bilibili_rank","startUrl":["https://www.bilibili.com/ranking/all/1/0/3"],"selectors":[{"id":"container","type":"SelectorElement","parentSelectors":["_root"],"selector":"li.rank-item","multiple":true,"delay":0},{"id":"title","type":"SelectorText","parentSelectors":["container"],"selector":"a.title","multiple":false,"regex":"","delay":0},{"id":"author","type":"SelectorText","parentSelectors":["container"],"selector":"a span","multiple":false,"regex":"","delay":0},{"id":"play_amount","type":"SelectorText","parentSelectors":["container"],"selector":".detail > span:nth-of-type(1)","multiple":false,"regex":"","delay":0},{"id":"danmu_amount","type":"SelectorText","parentSelectors":["container"],"selector":"span:nth-of-type(2)","multiple":false,"regex":"","delay":0},{"id":"video_detail_link","type":"SelectorLink","parentSelectors":["container"],"selector":"a.title","multiple":false,"delay":0},{"id":"coin","type":"SelectorText","parentSelectors":["video_detail_link"],"selector":"span.coin","multiple":false,"regex":"","delay":0},{"id":"collect","type":"SelectorText","parentSelectors":["video_detail_link"],"selector":"span.collect","multiple":false,"regex":"","delay":0},{"id":"share","type":"SelectorText","parentSelectors":["video_detail_link"],"selector":"span.share","multiple":false,"regex":"[0-9]+","delay":0},{"id":"num","type":"SelectorText","parentSelectors":["container"],"selector":"div.num","multiple":false,"regex":"","delay":0},{"id":"like","type":"SelectorText","parentSelectors":["video_detail_link"],"selector":".ops span.like","multiple":false,"regex":"","delay":0}]}

　　当你掌握了二级页面的抓取方式后，三级页面、四级页面也不在话下。因为套路都是一样的：都是先创建 Link 选择器、然后在 Link 选择器指向的下一个页面内抓取数据，我就不一一演示了。

0

2022-06-23

excel抓取多页网页数据

0 个评论

要回复文章请先登录或注册

AI时代内容工厂

简易数据分析 13 | Web Scraper 抓取二级页面（详情页）

0 个评论

发起人