八角鱼采集器如何使用?
优采云 发布时间: 2020-08-26 08:26八角鱼采集器如何使用?
步骤1打开网页
登陆优采云7.0采集器→点击左上角的“+”图标→选择自定义采集(也可以点击主页中自定义采集下方的“立即使用”),进入到任务配置页面。然后输入网址→保存网址,系统会步入到流程设计页面并手动打开上面输入的网址。
网页打开后,我们可以对任务名进行更改,不更改则默认以网页标题命名。在运行采集前可随时更改任务名。
步骤2提取数据
在网页中,直接选中须要提取的数据即可,窗口右上角会有对应的提示。本教程中我们以提取新闻标题、日期、正文为例,请诸位灵活运用,各取所需。
提取数据设置好,即可点击保存并开始运行采集。但是此时的数组名为系统手动生成的。为了愈加符合自己需求,可点击右上角“流程”进入流程页面对字段名进行更改。首先选中要更改中数组名,此时下拉框中会有备选数组名,可直接选定使用。如果没自己想要的,就输入新的数组名。修改好数组名后,点击“确定”进行保存。保存后即可运行采集。
所有版本均可运行本地采集,旗舰版及以上版本可运行云采集和设置定时云采集,但运行云采集前先运行本地采集进行测试。任务运行完采集后,可选Excel、CSV、HTML等格式进行导入或导出数据库。数据导入后可点击链接步入数据储存文件夹内查看数据,文件默认以任务名命名。
1.优采云采集原理
优采云网页数据采集客户端使用的开发语言是C#,运行在Windows系统。客户端主程序负责任务配置及管理,任务的云采集控制,云集成数据的管理(导出,清理,发布)。数据导入程序负责数据的导入Excel,SQL,TXT,MYSQL等,支持一次导入百万级别数据。本地采集程序负责按照工作流对网页进行打开,抓取,采集数据,通过正则表达式与Xpath原理,快速获取网页数据。整个采集流程基于Firefox内核浏览器,通过模拟人的思维操作方法(如打开网页,点击网页中的某个按键),对网页内容进行全手动提取。系统完全可视化流程操作,无需专业知识,轻松实现数据采集。通过对网页源码中各个数据XPath路径的精确定位,优采云可以批量化精准采集出用户所需数据。
2.优采云实现的功能
优采云网页数据采集系统以完全自主研制的分布式云计算平台为核心,可以在太短的时间内,轻松从各类不同的网站或者网页获取大量的规范化数据,帮助任何须要从网页获取信息的顾客实现数据自动化采集、编辑、规范化,摆脱对人工搜索及搜集数据的依赖,从而减少获取信息的成本、提高效率。涉及到政府、高校、企业、银行、电商、科研、汽车、房产、媒体等诸多行业及领域。
优采云作为一款通用的网页数据采集器,其并不针对于某一网站某一行业的数据进行采集,而是网页上所能看见或网页源码中有的文本信息几乎都能采集,市面上98%的网页都可以用优采云进行采集。
使用本地采集(单机采集),除了可以实现绝大多数网页数据的爬取,还可以采集过程中对数据进行初步的清洗。如使用程序自带的正则工具,利用正则表达式将数据低格。在数据源头即可实现清除空格、筛选日期等多种操作。其次优采云还有提供分支判定功能,可对网页中信息进行是与否的逻辑判定,实现用户筛选需求。
云采集除具有本地采集(单机采集)的全部功能之外,还可以实现定时采集,实时监控,数据手动去重并入库,增量采集,自动辨识验证码,API接口多样化导入数据以及更改参数。同时借助云端多节点并发运行,采集速度将远超于本地采集(单机采集),多IP在任务启动时手动切换还可避免网站的IP封锁,实现采集数据的最大化。