网页数据采集器如何使用

合集下载
  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。

网页数据采集器如何使用

新浪微博是目前国内比较火的一个社交互动平台,明星、各大品牌都有注册官方微博,有什么活动也都会在微博上宣传造势,和粉丝评论互动。普通人平常也喜欢将生活中的点滴分享到微博,所以微博聚集了大批的用户。本文就以使用八爪鱼采集器的简易模式采集新浪微博数据为例子,为大家介绍网页数据采集器的使用方法。

需要采集微博内容的,在网页简易采集界面里点击微博网页进去之后可以看到所有关于微博的规则信息,我们直接使用就可以的。

新浪微博数据采集器的使用步骤1

采集微博主页面或主页中不同版块的信息(下图所示)即打开微博主页后采集该页面的内容。

1、找到微博主页面信息采集规则然后点击立即使用

新浪微博数据采集器的使用步骤2

2、下图显示的即为简易模式里面微博主页面信息采集的规则

查看详情:点开可以看到示例网址

任务名:自定义任务名,默认为微博主页面信息采集

任务组:给任务划分一个保存任务的组,如果不设置会有一个默认组

网址:设置要采集的网址,如果有多个网址用回车(Enter)分隔开,一行一个。支持输入微博首页网址和首页各个子版本的网址,如

/?category=1760

示例数据:这个规则采集的所有字段信息

新浪微博数据采集器的使用步骤3

3、规则制作示例

例如采集微博主页面和社会版块的信息。设置如下图所示:

任务名:自定义任务名,也可以不设置按照默认的就行

任务组:自定义任务组,也可以不设置按照默认的就行

网址:从浏览器中将要采集网址复制黏贴到输入框中,本示例为/

/?category=7

设置好之后点击保存

新浪微博数据采集器的使用步骤3

保存之后会出现开始采集的按钮

新浪微博数据采集器的使用步骤4

4、选择开始采集之后系统将会弹出运行任务的界面

可以选择启动本地采集(本地执行采集流程)或者启动云采集(由云服务器执行采集流程),这里以启动本地采集为例,我们选择启动本地采集按钮

新浪微博数据采集器的使用步骤5

5、选择本地采集按钮之后,系统将会在本地执行这个采集流程来采集数据,下图为本地采集的效果

新浪微博数据采集器的使用步骤6

6、采集完毕之后选择导出数据按钮即可,这里以导出excel 2007为例,选择这个选项之后点击确定

新浪微博数据采集器的使用步骤7

7、然后选择文件存放在电脑上的路径,路径选择好之后选择保存

新浪微博数据采集器的使用步骤8

8、这样数据就被完整的导出到自己的电脑上来了哦

新浪微博数据采集器的使用步骤9

注:采集过程中如出现提示是否补采,请先选择“是”,程序即进行补采,注意观察页面数据量变化情况,如无增加,则再提示补采时请选择“否”。有则继续补采,云上会自动补采。

新浪微博数据采集器的使用步骤10

相关采集教程:

淘宝数据采集:

/tutorial/hottutorial/dianshang/taobao

京东爬虫:

/tutorial/hottutorial/dianshang/jd

天猫爬虫:

/tutorial/hottutorial/dianshang/tmall

阿里巴巴数据采集:

/tutorial/hottutorial/dianshang/alibaba

亚马逊爬虫:

/tutorial/hottutorial/dianshang/amazon

今日头条采集:

/tutorial/hottutorial/xwmt/toutiao

腾讯新闻采集:

/tutorial/hottutorial/xwmt/tenxunnews

天眼查爬虫:

/tutorial/hottutorial/qyxx/tianyancha

顺企网企业信息采集:

/tutorial/hottutorial/qyxx/shunqiwang

链家爬虫:

/tutorial/hottutorial/fangyuan/lianjia

八爪鱼——100万用户选择的网页数据采集器。

1、操作简单,任何人都可以用:无需技术背景,会上网就能采集。完全可视化流程,点击鼠标完成操作,2分钟即可快速入门。

2、功能强大,任何网站都可以采:对于点击、登陆、翻页、识别验证码、瀑布流、Ajax脚本异步加载数据的网页,均可经过简单设置进行采集。

3、云采集,关机也可以。配置好采集任务后可关机,任务可在云端执行。庞大云采集集群24*7不间断运行,不用担心IP被封,网络中断。

相关文档
最新文档