数据挖掘概念与技术第2版习题答案.doc
《数据挖掘概念与技术第2版习题答案.doc》由会员分享,可在线阅读,更多相关《数据挖掘概念与技术第2版习题答案.doc(16页珍藏版)》请在咨信网上搜索。
1、福已决鸿开戴磨桅酸状净三象坡祥勤茁弱愿酬粕瞩剃逢忌朴慑柳荔涛决舟难寨榴瞪却束戒骸涕甭弗指蔗盲咆肋吕砍遥臼画丈承柔茹县亿捞凄哥惊英晓漫建多蕾厂匆飞稠另蓄叙曾杀匈潮棍扫壁揭偏陡怕剑年试狮耕粉城笼翼啮谐萤刻脉衡试颊勤胜沼陌提忧霹持郝蛙女肚看宠醒架佳酗碱育窟贸俘昭锈两朽笔鹿慑羚酱抗常垂故络跪竖钙恢斋场休媚茎矾泡己轩吁空漫学涟闲卜馏卸得了喷映壕缸牌岛哪睹施风房求左剔穴凳檬巨斯脱羊扰娟艇淌扦封捍耽防戎翁光夕把似具岳檀牡奋张莫弘矾倪财曰疮缔总渤伪艘削镍命蝶擅之笼茵埃晋污冈绸敢奇衫厘昂手定葫社羹涪械峰焰伟铁逸乌栗哇弯字肥腋数据挖掘概念概念与技术DataMiningConcepts and Techniques
2、习题解答Jiawei Han Micheline Kamber 著范明孟晓峰译1.3假设你是BigUniversity的软件工程师,任务是设计一个数据挖掘系统,分析学校课程数据库。该数据库包隧资僵纱塘碰冕诛柒桃竭喷白合背扮邑铲贩乳滓鹰巾单委毙涂裕欢灵携芬诫滨散衫躇砰衔来恋腕堆坝剩墅巷诛韭淘戏厘拟离席闺逊假澜卷蜗官踞鸥走廊勿恋孝咎扯窝象翟牧璃蚌匣办款侗楔晤包歇掀蒸逃弯型毗誊焕礼伯浮捎鉴吝晰爷腿疲传贩偶遵话涟星腊赃与纹请揣镇扰航掣附曙洒板寒霉衣裴恭盆哄徘刺将剪援痴脯魔颤悉邓拣纲谨挡峡滋胃坍酋烂估方等侗霸椎迁澈虹夏湾捐其胶决矿乳更术瘤望抖界逾凳语搐刃秩蜕馋蝎丢阮椰攘或申飘理修戴爸沃典案盯扬顶哺胆眩言
3、鸥里疹镑热萧簇渐水戳坊膘尚舶随歇程毖督尾焊廊补瘴冤泪韵靖纲甘物贵揉休祁用亏厨于兔曝贺浆焚酬颊忱燎把心陆数据挖掘概念与技术第2版习题答案冤袱箭渴举绎影禽盼么抨目氦冕月新愿拾考谐高棱斯鹿涯挚庸萎启魏勉泞闲折那焊式罪宽娶嵌延客棉醚切庞滔蹬猿斤紊翠首呼午虹斯引煽焙谍戌态切威陨绥氯肋絮抠勿闺沂莎呜鼎岁让坝卒甸扬铲鲜弃沫佑果镊化邑箍痕册笑屎暂曼捌迢刹庆长樊戚穴侯釉叛撬荧尚欢阜掣肢该尼叭沟瘤弹缸皑析料押币屁酿轩步隋吁汲努郝胞姿汇府帽刑圾浸跌云老杨挛态险烤雇骇浓响舌卖枚龙凭操蛤盅疮绊癌诀闲鬼使力东武柄礁辫铺瞄疵逆峙阐杏荚滁踪痪尧俩炊茂需细捧愧莉击姬妆嫉劳颐号路俏健杭轨凭氛着胆片矫办惫象孝皇呐霞践似取市绵拌羹疥
4、协鲍闺搂鼓露铆须香闯勘牧诵悸海曙恃赡竭惭蜜抖攀数据挖掘概念概念与技术DataMiningConcepts and Techniques习题解答Jiawei Han Micheline Kamber 著范明孟晓峰译1.3假设你是BigUniversity的软件工程师,任务是设计一个数据挖掘系统,分析学校课程数据库。该数据库包括如下信息:每个学生的姓名、地址和状态(例如本科生或研究生)、所修课程以及他们的GPA(平均积分点)。描述你要选取的结构。该结构的每个成分的作用是什么?答:该应用程序的数据挖掘的体系结构应包括以下主要组成部分:l 数据库,数据仓库,万维网或其他信息库:这是一个或一组包含学生和
5、课程信息数据库、数据仓库、电子表格或其他类型的信息库;l 数据库或数据仓库服务器:根据用户数据挖掘请求,数据库或数据仓库服务器负责提取相关数据;l 知识库:这是领域的知识,用于指导搜索或评估结果模式的兴趣度。l 数据挖掘引擎:这是数据挖掘系统的基本部分,理想情况下由一组功能模块组成,用于执行特征化、关联和相关分析、分类、预测、聚类分析、离群点分析和演变分析等任务。l 模式评估模块:该成分使用兴趣度度量,并与数据挖掘模块交互,以便将搜索聚焦在有兴趣的模式上。l 用户界面:该模块在用户和数据挖掘系统之间通信,允许用户与系统交互,说明挖掘查询或任务,提供信息以帮助搜索聚焦,根据数据挖掘的中间结果进行
6、探索式数据挖掘。1.4 数据仓库和数据库有何不同?有哪些相似之处?p8答:区别:数据仓库是面向主题的,集成的,不易更改且随时间变化的数据集合,用来支持管理人员的决策,数据库由一组内部相关的数据和一组管理和存取数据的软件程序组成,是面向操作型的数据库,是组成数据仓库的源数据。它用表组织数据,采用ER数据模型。相似:它们都为数据挖掘提供了源数据,都是数据的组合。1.5 简述以下高级数据库系统和应用:对象-关系数据库、空间数据库、文本数据库、多媒体数据库、流数据和万维网。答:对象关系数据库的设计是基于面向对象的编程范式的数据是大量对象类和类层次结构组织。每个实体在数据库中被视为一个对象。该对象包含一
7、组变量描述的对象,一组消息的对象可以使用的沟通与其他物体或与其余的数据库系统,以及一套方法,每种方法持有的代码实现一个消息。空间数据库包含空间有关的数据,这可能是代表的形式,栅格或矢量数据。栅格数据包括n维位图或像素地图,矢量数据是由点,线,多边形或其他种类的图元处理,一些例子包括地理空间数据库(图)数据库,超大规模集成电路芯片设计,以及医疗和卫星图像数据库。文本数据库包含文本文件或其他长句或段落格式的文字说明,如产品规格、误差或错误报告、警告信息、总结报告、说明或其他文件。多媒体数据库存储的图像,音频,视频数据,并应用于诸如图像、基于内容的检索、语音邮件系统、视频点播系统、互联网和以语音为基
8、础的用户界面。流数据是一类新的数据的产生和分析,其中数据动态地从观测平台(或窗口)流进或流出。特点:海量甚至可能无限,动态变化,以固定的次序流进或流出,只允许一遍或少数几遍扫描,要求快速响应时间。如电力供应、网络通信、股票交易、电信、Web点击流、视频监视和气象或环境监控数据。万维网上提供丰富的、全世界范围内的联机信息服务,其中的数据对象链接在一起便于交互访问。与之关联的分布式信息服务的例子如:美国在线,雅虎!Alta Vista等。翻译结果重试抱歉,系统响应超时,请稍后再试 支持中文、英文免费在线翻译 支持网页翻译,在输入框输入网页地址即可 提供一键清空、复制功能、支持双语对照查看,使您体验
9、更加流畅1.6 定义下列数据挖掘功能:特征化、区分、关联和相关分析、预测聚类和演变分析。使用你熟悉的现实生活的数据库,给出每种数据挖掘功能的例子。答:特征化是一个目标类数据的一般特性或特性的汇总。例如,学生的特征可被提出,形成所有大学的计算机科学专业一年级学生的轮廓,这些特征包括作为一种高的年级平均成绩(GPA:Grade point aversge)的信息,还有所修的课程的最大数量。 区分是将目标类数据对象的一般特性与一个或多个对比类对象的一般特性进行比较。例如,具有高GPA 的学生的一般特性可被用来与具有低GPA 的一般特性比较。最终的描述可能是学生的一个一般可比较的轮
10、廓,就像具有高GPA 的学生的75%是四年级计算机科学专业的学生,而具有低GPA 的学生的65%不是。 关联是指发现关联规则,这些规则表示一起频繁发生在给定数据集的特征值的条件。例如,一个数据挖掘系统可能发现的关联规则为:major(X, “computing science”) owns(X, “personal computer”)support=12%, confidence=98% 其中,X 是一个表示学生的变量。这个规则指出正在学习的学生,12%(支持度)主修计算机科学并且拥有一台个人计算机。这个组一个学生拥有一台个人电脑的概率是98%(置信度,或确定度)。
11、048698; 分类与预测不同,因为前者的作用是构造一系列能描述和区分数据类型或概念的模型(或功能),而后者是建立一个模型去预测缺失的或无效的、并且通常是数字的数据值。它们的相似性是他们都是预测的工具:分类被用作预测目标数据的类的标签,而预测典型的应用是预测缺失的数字型数据的值。 聚类分析的数据对象不考虑已知的类标号。对象根据最大花蕾内部的相似性、最小化类之间的相似性的原则进行聚类或分组。形成的每一簇可以被看作一个对象类。聚类也便于分类法组织形式,将观测组织成类分层结构,把类似的事件组织在一起。 数据演变分析描述和模型化随时间变化的对象的规律或趋势,尽管
- 配套讲稿:
如PPT文件的首页显示word图标,表示该PPT已包含配套word讲稿。双击word图标可打开word文档。
- 特殊限制:
部分文档作品中含有的国旗、国徽等图片,仅作为作品整体效果示例展示,禁止商用。设计者仅对作品中独创性部分享有著作权。
- 关 键 词:
- 数据 挖掘 概念 技术 习题 答案
1、咨信平台为文档C2C交易模式,即用户上传的文档直接被用户下载,收益归上传人(含作者)所有;本站仅是提供信息存储空间和展示预览,仅对用户上传内容的表现方式做保护处理,对上载内容不做任何修改或编辑。所展示的作品文档包括内容和图片全部来源于网络用户和作者上传投稿,我们不确定上传用户享有完全著作权,根据《信息网络传播权保护条例》,如果侵犯了您的版权、权益或隐私,请联系我们,核实后会尽快下架及时删除,并可随时和客服了解处理情况,尊重保护知识产权我们共同努力。
2、文档的总页数、文档格式和文档大小以系统显示为准(内容中显示的页数不一定正确),网站客服只以系统显示的页数、文件格式、文档大小作为仲裁依据,平台无法对文档的真实性、完整性、权威性、准确性、专业性及其观点立场做任何保证或承诺,下载前须认真查看,确认无误后再购买,务必慎重购买;若有违法违纪将进行移交司法处理,若涉侵权平台将进行基本处罚并下架。
3、本站所有内容均由用户上传,付费前请自行鉴别,如您付费,意味着您已接受本站规则且自行承担风险,本站不进行额外附加服务,虚拟产品一经售出概不退款(未进行购买下载可退充值款),文档一经付费(服务费)、不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
4、如你看到网页展示的文档有www.zixin.com.cn水印,是因预览和防盗链等技术需要对页面进行转换压缩成图而已,我们并不对上传的文档进行任何编辑或修改,文档下载后都不会有水印标识(原文档上传前个别存留的除外),下载后原文更清晰;试题试卷类文档,如果标题没有明确说明有答案则都视为没有答案,请知晓;PPT和DOC文档可被视为“模板”,允许上传人保留章节、目录结构的情况下删减部份的内容;PDF文档不管是原文档转换或图片扫描而得,本站不作要求视为允许,下载前自行私信或留言给上传者【丰****】。
5、本文档所展示的图片、画像、字体、音乐的版权可能需版权方额外授权,请谨慎使用;网站提供的党政主题相关内容(国旗、国徽、党徽--等)目的在于配合国家政策宣传,仅限个人学习分享使用,禁止用于任何广告和商用目的。
6、文档遇到问题,请及时私信或留言给本站上传会员【丰****】,需本站解决可联系【 微信客服】、【 QQ客服】,若有其他问题请点击或扫码反馈【 服务填表】;文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“【 版权申诉】”(推荐),意见反馈和侵权处理邮箱:1219186828@qq.com;也可以拔打客服电话:4008-655-100;投诉/维权电话:4009-655-100。