广州一分钟了解互联网数据挖掘流程

来源：　　发布者：ld88520　　发布时间：2015-12-19　　查看：47406次

摘要：

1、爬虫抓取网络数据

真实的数据挖掘项目，一定是从获取数据开始的，除了通过一些渠道购买或者下载专业数据外，常常需要大家自己动手爬互联网数据，这个时候，爬虫就显得格外重要了。

Nutch爬虫的主要作用是从网络上抓取网页数据并建立索引。我们只需指定网站的顶级网址，如taobao.com，爬虫可以自动探测出页面内容里新的网址，从而进一步抓取链接网页数据。nutch支持把抓取的数据转化成文本，如（PDF、WORD、EXCEL、HTML、XML等形式）转换成纯文字字符。

Nutch与Hadoop集成，可以将下载的数据保存到hdfs，用于后续离线分析。使用步骤为：

向hdfs中存入待抓取的网站url

$ hadoop fs -put urldir urldir

注：

第一个urldir为本地文件夹，存放了url数据文件，每行一个url地址

第二个urldir为hdfs的存储路径。

启动nutch，在NUTCH_HONE目录下执行以下命令

$ bin/nutch crawlurldir –dir crawl -depth 3 –topN 10

命令成功执行后，会在hdfs中生成crawl目录。

2、MapReduce预处理数据

对于下载的原始文本文档，无法直接进行处理，需要对文本内容进行预处理，包括文档切分、文本分词、去停用词（包括标点、数字、单字和其它一些无意义的词）、文本特征提取、词频统计、文本向量化等操作。

常用的文本预处理算法是TF-IDF，其主要思想是，如果某个词或短语在一篇文章中出现的频率高，并且在其他文章中很少出现，则认为此词或者短语具有很好的类别区分能力，适合用来做分类。

输入原始文本内容：

Againit seems that cocoa delivered……

执行TF-IDF预处理：

hadoop jar $JAR SparseVectorsFromSequenceFiles……

输出文本向量:

9219:0.246 453:0.098 10322:0.21 11947:0.272 ……

每一列是词及其权重，使用冒号分隔，例如“9219:0.246”表示编号为9219的词，对应原始单词为“Again”，其权重值为0.246。

3、Mahout数据挖掘

预处理后的数据就可以用来做数据挖掘。Mahout是一个很强大的数据挖掘工具，是分布式机器学习算法的集合，包括：协同过滤、分类、聚类等。

以LDA算法为例，它可以将文档集中每篇文档的主题按照概率分布的形式给出。它是一种无监督学习算法，在训练时不需要手工标注主题，需要的仅仅是指定主题的数量K。此外LDA的另一个优点则是，对于每一个主题均可找出一些词语来描述它。

输入预处理后的数据:

9219:0.246 453:0.098 ……

执行LDA挖掘算法：

mahout cvb –k 20……

输出挖掘结果：

topic1 {computer,technology,system,internet,machine}

topic2 {play,film,movie,star,director,production,stage}

我们可以获知用户的偏好是哪些主题，这些主题是由一些关键词组成。

联系客服咨询项目信息

咨询客服获取优惠信息

马上留言获取最新资料

: 广州所有服务项目
关注人气：135551人

: 广州服务项目
关注人气：130832人

: 广州品牌升级
关注人气：129421人

: 广州品牌设计
关注人气：131080人

: 广州商业模式
关注人气：132006人

新闻中心

服务项目

联系我们

24小时服务热线zbkj10086（客服微信）

手机号码zbkj10086（客服微信）
公司电话zbkj10086（客服微信）
企业邮箱zbkj10086（客服微信）
咨询QQ
公司地址四川省成都市锦江区红星路三段IFS国际金融中心

中宾科技有限公司

广州一分钟了解互联网数据挖掘流程

来源：　　发布者：ld88520　　发布时间：2015-12-19　　查看：47406次

推荐服务

新闻中心

服务项目

联系我们

广州一分钟了解互联网数据挖掘流程

来源： 发布者：ld88520 发布时间：2015-12-19 查看：47406次

推荐服务

新闻中心

服务项目

联系我们

来源：　　发布者：ld88520　　发布时间：2015-12-19　　查看：47406次