本节课我们开始学习如何写一条正确的叉 pass, 以便在 html 文档中定位目标数据。由于叉 pass 是根据 html 特性去定位数据的,所以我们先了解一下 html 的基础知识。 html 文档由标签、属性、属性值、文本等内容构成,标签就是 liul、 div, 这些用浅蓝色表示。属性跟在标签后翻过号里,后面这些 class, h, i, f, title、 acclick 等等用深蓝色表示属性值。引号里的这些用红色表示, 文本直接显示在网页上的文本用黑色表示。这些标签和属性是什么意思呢?我们结合十六网址来看一下。以豆瓣图书的网页为例,这个 a 标签是超链接,点击之后就会跳转到另一个页面,目标网址就是 h i f 属性里的这个值。 p 是段落标签,通常包含一个文本,类似于 word 文档中的一个段落。 img 是图片标签,通常包含一个 src 属性, 里面是图片文件的 ul 地址。 d i v 是一个跨级元素,可以对网页内容进行分割,比如图片,这里可以是一个 d i v 基本信息,也可以是一个 d i v 整个列表也可以是一个 d i v l i 是一个列表元素。像比如豆瓣图书的每一个条目都是一个 l i, 多个 l i 就构成了一个列表,这个列表是 u l。 再来看天天寂静的网页,这里 table 标签是整个表格, tr 标签是表 表格中的一行, td 标签是一个单元格,以及大部分标签包含 class 属性,这个属性可以用来区分于其他同名的标签,比如这里每个 div 的 class 属性都不同, id 属性是每个标签唯一的属性值,在 html 里独一无二,就像我们每个人的身份证号码一样, 在实际采集数据过程中,我们可能会遇到其他很多标签,属性和属性值不知道他是什么意思, 没有关系,我们并不需要知道每个标签属性或者属性值的意思,写网页的人才需要知道这些。我们只要能找到标签属性、属性值的相同或者不同之处,利用其特征去定位到数据就可以了。 二、标签之间具有层级由于 html 文档是竖状结构,所以标签之间还具有层级关 关系主要有父、子、兄这三种关系。每个标签都有一个父标签,但是不一定有子标签。比如 ul 是所有 li 的负极标签, li 是 ul 的子标签, 这些 l i 标签都拥有一个副标签 u l, 所以他们之间是同级标签,也就是兄弟关系。我们可以通过观察代码的缩进情况来判断他们之间的关系。 掌握了 h t m l 的基础知识后,我们就可以试着去写一条叉 pass。 首先观察几个自动生成的叉 pass, 发现他们都有相似的三个部分构成。第一部分, html body l i a, 他们叫做标签。第二部分,单斜杠或者双斜杠,他们是用来连接标签。第三部分,标签后 方括号中的内容,利用标签的属性或文本进行定位,所以本质上叉 plus 通过 html 标签和属性定位数据,并有固定的写法组成相似的结构。 下面具体讲如何通过标签和属性定位如何连接标签。一、通过标签和属性定位 通过标签和属性定位具有固定的写法,先找到要定位的标签,然后将用到的属性放在标签后面的方括号里,属性前加 at 属性值放在引号内。 比如 l i at class 等于 subsect item。 这条叉 pass 的意思是定位 h t m r 文档中所有 class 属性为 subsect attem 的 l i 标签。在豆瓣首页定位顶部读书菜单的叉 pass 是 a at class 等于 link book, 含义是定位 h t m 文档中 class 属性为 link book 的 a 标签。定位电源海报的叉 pass 是 a m g at alt 等于金刚穿,含义是定位 h t m 文档中 alt 属性为金刚穿的 a m g 标签。注意,叉 pass 的写法可能并不唯一,我们应该在能实现精准定位的前提下,力求简洁。 二、单斜杠和双斜杠的区别前面我们说过标签具有层级,那在叉 pass 中使用单斜杠和双斜杠具有不同的效果。 单斜杠是绝对路径定位,意思是从根标签开始,一层一层向下定位,直到数据所在的位置,不可以跨越层级。双斜杠是相对路径定位,直 直接通过数字的标签和属性找到所在层级进行定位,可以跨越层级。我们强烈推荐这种定位方法。以多半小说这个网页为例,我们想定位到活着这本书的标题,用绝对录制定位的写法是, 标签后紧跟着的数字是序号,比如 div 三代表同级的第三个 div 标签。这种写法需要从根标签一层一层往下定位,比较死板,一旦中间标签有任何变化,整条叉 pass 就失效了。 如果使用相对路径定位,我们只需要这个标题的标签是什么,有什么特别的属性就可以了,观察发现他的标签是 a, 包含了一个开头属性,并且值为活着,这个是区别于其他 a 标签的关键,因此可以 写成 a at 胎头等于活着。点击回车成功定位。这种写法只要原码中存在胎头属性为活着的 a 标签就可以直接定位到,就算网页的标签层级发生变化, 这条叉 pass 也依然有效。单形杠和双形杠是可以组合使用的,我们需要根据网页情况灵活使用。比如说定位到所有小说的封面图片,首先可以通过 l i at class 等于 subject item 定位到所有小说,然后通过 div a i m g 向下定位,写法是 i y at class and subset item 单斜杠 div 单斜杠 a 单斜杠 i m g 点击回车看所有小说图片就都被定位到了。 本节课我们学习了如何通过标签和属性来写一条定位叉 pass, 但在实际采集过程中,只掌握标签和属性的定位方法还不够,还需要用到函数来帮助我们定位。下节课我们就来详细讲解叉 pass 函数如何使用。
粉丝1199获赞943

本节课我们主要讲的是结合实力如何修改循环翻页的 spas。 当我们在采集翻页的网页数据的时候,遇到一些网页的翻页 xpos 定位不准确,导致不能正常翻页采集所有数据,比如一直重复采集某几页的数据, 需要通过修改循环翻页 exposs 让翻页定位准确。这种情况我们该如何修改循环翻页 expose? 以这个网址为例, 我们采集百度资讯搜索关键词之后的标题信息,为了方便观察,我们设置采集验码字段。 配置好采集规则后,我们启动本地采集,点击 右上角的显示网页,观察采集窗口网页的运行状况。可以看到采集第一页和第二页是正常的,但是第二页后就开始重复采集第一页和第二页的数据,第二页之后的数据就无法采集,到了 这个时候就需要我们检查修改循环翻页的 spas 一共有三个步骤, 第一个步骤,复制循环翻页 sport, 到浏览器里调试。我们到八爪鱼采集器里打开任务,点击循环翻页框, 在接触设置里找到元素 spos, 然后复制到火狐 pspos 工具里进行调试。我们可以发现在第一页时能定位到下一页按钮,点击翻页到第 第二页,发现 spot, 同时定位到了上一页和下一页按钮,因为上一页按钮在前面,在八爪鱼采集器里默认的是第一个,所以会定位到上一页按钮,点击上一页, 从而导致采集完第二页后就又返回到第一页开始采集,不断循环重复。 第二个步骤,观察源码写翻页 spas。 我们在第二页的时候需要指定位到下一页的按钮,不需要定位到上一页,这个时候我们在第二页观察源码上一页和下一页的区别, 可以发现这两个按钮可以用 text 函数定位下一页文本,写一条 spots, 我们可以看到这条 expose 就只能定位到下一页按钮了。第三个步骤,复制修改好的 expose 到八爪鱼,点击循环翻页步骤,进入设置粘贴手写的 expose。 这里要注意的是点击循环翻页,而不是点击翻页,然后点击保存启动采集, 可以发现采集正常翻页了,依次采集每一页的数据。 总的来说,循环翻页 xbox 把握一个原则就好,写一条 xbox, 使其始终只能定位到当前页面的下一页按钮,且最后一页要定位不到任何信息。 以上就是关于修改循环翻译 expose 的讲解内容,大家可以结合 expose 相关教程一起学习下。

本视频主要讲解边点击加载更多边采集数据的场景。很多网站是通过不断点击加载更多、显示更多等类似按钮加载出新数据的,比如搜狗微信首页通过点击加载更多内容,加载新数据,微博评论通过点击加载更多加载新数据等。 下面介绍具体设置方法。第一种是使用智能识别实现边点击边采集。八爪鱼的智能识别功能可以帮助我们自动实现边点击边采集,以果壳物种日历为例演示一下。首先在首页输入框中 输入目标网址,点击开始采集八爪鱼,自动打开网页,打开网页后选择智能识别网页, 智能识别结束后,可以看到 它自动识别了页面的滚动加载更多按钮和列表数据,然后点击生成采集设置,可自动生成相应的采集流程, 方便我们编辑修改。看一下这个流程,他是通过循环加载更多按钮和循环列表的嵌套来实现边点击边采集数据的。有时候我们只需要采集点击指定次数后的页面数据,可以在循环翻页的步骤设置点击加载的次数。 例如这里我们设置循环执行次数为五次,在实际操作过程中,大家可根据实际情况进行调整。 最后启动采集。来看一下 八爪鱼。点击一次后采集第一次点击后加载的 数据,继续点击第二次采集第二次点击后加载的数据,直至数据全部采集完成。如果不使用智能识别,也可自行配置采集任务。实现边点击边采集。以创业帮资讯网页为例进行演示。首先在首页输入框中 输入目标网址,点击开始采集。八爪鱼自动打开网页,但是网页打开后就不使用智能识别了,手动配置提取列表数据步骤, 视力中我们提取列表数据,选中一个列表,选中子元素,选中全部采集数据,生成一个循环列表。接下来就是创建循环,点击了找到并选中查看更多资讯内容按钮,在弹出的操作提示框中选择循环,点击单个链接, 自动生成一个循环翻页步骤,自动生成的循环翻页步骤中内嵌循环列表步骤,这样我们就能实现边点击边采集数据,同样这里我们设置翻页次数为五次,最后启动采集来验证一下, 可以看到八爪鱼点击一次后采集第一次点击后加载的数据,继续点击第二次采集第二次点击后加载的数据,直到数据全部采集完成。 最后回顾一下,一、实现边点击边采集数据的关键在于循环加载更多按钮和循环列表的嵌套,不管是自动识别还是手动配置都是这样的,建议大家选择自动识别。 二、观察网页,点击加载更多的次数,设置合理的翻页次数有利于提升采集的效率。

首先我们打开电脑上的八爪鱼采集器,然后在新建,这里点击自定义任务, 然后任务组就默认为我的任务组,然后采集网址是手动输入在网址这里,嗯,这里需要粘贴网址,首先我们打开三六零极速浏览器,然后输入京东,然后在京东官网上 输入小米手机,搜索小米手机,然后我们这里复制一下小米手机的网址,在八爪鱼采集器中,我们粘贴网址,点击保存设置, 这里正在打开网页, 正在识别网页数字, 全部识别好网页数据之后,我们这里点击生成采集设置, 然后我们点击右上角的采集,我们点击启动本地采集,启动本地采集数据保存在会保存在本地电脑上, 然后八爪鱼软件开始采集数据,现在正在采集, 我们大概需要采集两百四十条数据信息,现在已经采集二十条,等到已采集两百四十条的时候, 我们点击停止采集, 一般数据采集多于两百条比较有代表性, 我们这里确定停止本地排气,然后导出数据,然后去重数据,去掉重复的数据,然后我们通过 xl 导出,然后保存在电脑上我们的。

这一节我们讲一下用数据工具爬取 平台数据,供我们这个运营使用啊,那讲一下,第一个是智能排名前二十页的 数据爬曲啊,那我们打开八爪鱼彩机器, 那这个爬取主要是爬取哪里的数据呢?我们到阿里巴巴首页 登录,到首页输入你要爬去的关键词, 这个关键词一般是内幕里面的大词, 小字,小字作用不大,那么这个大词我们要爬取除了广告之外的啊,这些智能排名的靠前数据 啊。那这里面我们可以抓取到可视部分标题,价格区间 起的量,年份,公司名称, 成交量,平台的星级啊,来我们演示一下。 那首先我们在八爪鱼的这个自定义任务这里点击 输入阿里巴巴的链接,在这里新建一个 新建任务组的名称,比如说 没给阿婆布拉去设置前二十页的数据保存,设置 保存设置之后我们就到了采集流程图这里啊,那么在这个界面我们安走这个采集 流程,采集流程先操作一遍,在这个显示框当中 操作一遍,系统会抓取到这个操作入境。那我们现在来演示一下,点一下搜索框, 搜索框里面是不能直接输入的,点击搜索框之后,在右边的这个弹窗里面有一些 指定的按钮,那么在这里面我们要做什么动作就选择什么样的这个功能。在这里我们是要输入文本,输入哪一个文本呢? mateppar 去设置, 点击确认就开始输入,我们选搜索这个命令是不是采集, 我们是点击盖按钮啊,点击盖按钮让让机器自动识别 这个网页,那么机器会从上到下进行搜索, 自己会判别判别要抓取哪些内容,然后进行分类,我们等一下, 好,已经识别完成,那么这里识别完成了之后,就形成了识别结果,有三类 啊,三类,我们目前在第一类,在这个地方啊,我们要抓取的数据就是这些, 就是这些,看一下哈,如果说没问题就是这些,我们看一下。第二个,这些数据是我们不要的啊,这个数据我们也是不需要的啊,我们出来第一个数据 取消翻页采集,这里做滚动加载数据, 这个在不断滚动的过程当中再加载申请采集设置, 那现在下面还在 啊,已经缓冲进来了,那么这个数据下面的数据就是一个赛表格的展示的数据, 那么这里面有标题,标题链接图片啊,在这个地方有价格啊这些,嗯,还有些这样的,这个体力量啊,迷你欧的啊,什么东西啊?还有这些链接, 如果这里面可以去修改啊,比如说这价格区间,这是单位,可以改成单位, 这个可以梗起定量,这些可以不抓取, 真爽。 其他的不需要的也可以在这里设置这个免中心,设置名称或者删除掉啊。 我们把这个拿到下面来,点击翻页循环,点击单个元素, 那整整个的这个路径 就在左边这个弹窗框里面全部展示出来。那么在这个 流程图当中,我们他抓取了从输入到点击啊,然后到这个啊元素数据提取, 然后找到翻页这么几个步骤,这几个步骤完了之后,我们要在这里做下优化啊,比如说我们再提取数据,数据这里 循环当中元素这个地方的改是跟这些地方是一样的,这个地方 他的内容跟这个内容是一模一样的,一个是纵向展示,一个是产向展示啊,这是采集这些循环元素 叶面加之后向下滚动,滚动次次数每次三次,每次十五一秒,应用翻页循环,翻页循环次 我们前二十一。那么在这个首页当中啊,这种搜索,搜索页面当中 去去去翻页的话,经常会出现广告或者一些弹窗的东西, 我们在这里把它勾选啊,保存被子,这里保存,开始采集啊,如果说是有会员的,这里可以启动云采集,云采集的速度会被本地采集 速度更高啊,这里是本地采集,本地采集,采集完了之后会提示你直接是不是要导入,导出数据再存到电脑里面啊?这样的加载速度会慢一点。 那么我们启动云彩机,这个任务就完成了 啊,这个任务新建任务就完成,我们看一下这个任务啊,现在才开始运行, 我们可以看一下这个演示过程,看一下本地材质 本地采集,可以看到整个采集流程, 他怎么操作的?那现在开始踩,踩的速度也很快。好,我们停止采集,退出 这个亭子,我们让他做云端菜鸡。好,这是智能排名前 二十页的数据,爬去。