优采云采集工具特色功能与设置规则一览

优采云 发布时间: 2020-08-22 01:05

  优采云采集工具特色功能与设置规则一览

  5、自带下载工具,可将批量高效的采集数据下载,效率比专业的批量下载软件更快;

  6、系统自带的模块文件支持:风讯文章,动易文章,动网论坛,PHPWIND论坛,Discuz峰会,phpcms文章,phparticle文章,LeadBBS峰会,魔力峰会,Dedecms文章,Xydw文章,惊云文章等的模块文件。

  7、假如设定好要发布的模块,可以手动发布数据,前台展示。

  8、可针对网站的特定内容进行采集,刨除不相干内容;

  9、能将同类型内容进行采集合并,展现在同一个数据表中;

  10、自带伪原创工具,自动替换单词,提高编辑效率....................

  优采云采集工具内容采集设置规则:

  1)运行优采云工具

  2)点击任务列表,新建任务,填写任务名,网站编码选择手动获取就行。

  3)添加起始网址

  填写“第一步:采集网址规则”先填写起始网址,通常为目标站首页地址。点击“添加”。

  这里会根据网站的树状结构逐级获取下一级结构的网址,直至获取到内容页的网址。然后依次点击“添加” ->“完成”。

  4)编写“多级网址获取”规则

  这里须要先在起始地址页面找到所有须要采集的栏目页的代码区域,先查看起始页地址的源码,找到如图所示代码区域:

  5)添加网址采集规则

  点击左侧“添加”按钮打开“添加多级网址采集规则”,选择“从页面手动剖析得到地址链接”单选按键,在下边“从该选取区域中提取网址”,“从”(左侧)文本框填上栏目地址代码区域开始之前的标志性代码(要保证其在该页的唯一性),“到”右侧文本框填上栏目地址代码区域结束以后的标志性代码,在“结果网址过滤”的“必须收录”和“不得收录”文本框填上相应代码,如果该区域没有多余的链接不需要过滤,可以不填,这里的栏目页网址必须收录“category-”。然后点击“保存”返回。

  6)获取内容页面地址

  先打开栏目页查看源码,查找内容页地址存在的区域及地址规律。按照上一步的方式先填写内容页所在区域的起始和结束标志性代码,然后剖析这个区域中收录的链接与我们说须要的内容页地址链接规律,添加过滤代码。这里起始代码为“”,结束代码为“

  ”过滤代码为必须收录“read-”不得收录“#”。

  7)获取网页标题采集

  先打开内容页以及内容页的源码,找到须要提取的信息的前后代码特点。以提取标题和内容为例。首先复制文章标题,然后在源码中查看该标题出现的几处地方,找一处前后代码在每一篇文章都一样的地方,该例共出现了3处,第二处的代码没有其他干扰代码。点击“添加”,标签名填“标题”,提取数据形式选择前后截取,前后代码分别为“”和“”。如果采集的内容须要作进一步处理(如替换删掉编码转换过滤html等),在下方“数据处理”点击添加填写相应规则。

  8)获取内容

  再添加一个标签,标签名为“内容”,按照上述方式填写内容的前后代码片断,需要注意的是,前后代码片断最好不要出现不完整的标签(如:“

  ”,一个完整的标签应当是以“”结束,如果之间的内容在各个内容页有一部分不一样,将不一样的部份用(*)代替即可),否则提取的内容会收录部份不完整的标签。通常正文收录的HTML会比较多,可以添加HTML过滤功能,建议仅保留段落(p)、图片(img)、换行(br)等标签。

  9)开始采集

  选择要采集的任务规则,勾选“采网址”和“采内容”复选框,点击工具栏“开始”按钮。

  10)后续工作

  采集到的数据保存在数据库,可以通过在任务名上点右键,选择“打开DATA下任务文件夹”打开数据库所在位置,该数据库可以通过ACCESS打开和编辑。如果想要重新采集,需要通过右键选择“清空该任务网址库”和“清空任务所有采集数据”。

0 个评论

要回复文章请先登录注册


官方客服QQ群

微信人工客服

QQ人工客服


线