天大《数据库原理》拓展资源.pdf
上传人:qw****27 上传时间:2024-09-12 格式:PDF 页数:4 大小:14KB 金币:15 举报 版权申诉
预览加载中,请您耐心等待几秒...

天大《数据库原理》拓展资源.pdf

天大《数据库原理》拓展资源.pdf

预览

在线预览结束,喜欢就下载吧,查找使用更方便

15 金币

下载此文档

如果您无法下载资料,请参考说明:

1、部分资料下载需要金币,请确保您的账户上有足够的金币

2、已购买过的文档,再次下载不重复扣费

3、资料包下载后请先用软件解压,在使用对应软件打开

《数据库原理》拓展资源数据挖掘介绍1、什么是数据挖掘当今数据库的容量已经达到上万亿的水平(T)---1,000,000,000,000个字节。在这些大量数据的背后隐藏了很多具有决策意义的信息,那么怎么得到这些“知识”呢?也就是怎样通过一颗颗的树木了解到整个森林的情况?计算机科学对这个问题给出的最新回答就是:数据挖掘,在“数据矿山”中找到蕴藏的“知识金块”,帮助企业减少不必要投资的同时提高资金回报。数据挖掘给企业带来的潜在的投资回报几乎是无止境的。世界范围内具有创新性的公司都开始采用数据挖掘技术来判断哪些是他们的最有价值客户、重新制定他们的产品推广策略(把产品推广给最需要他们的人),以用最小的花费得到最好的销售。数据挖掘是一个利用各种分析工具在海量数据中发现模型和数据间关系的过程,这些模型和关系可以用来做出预测。数据挖掘的第一步是描述数据---计算统计变量(比如平均值、均方差等),再用图表或图片直观的表示出来,进而可以看出一些变量之间的相关性(比如有一些值经常同时出现)。选择正确的数据源对整个数据挖掘项目的成败至关重要,在后面数据挖掘的步骤中我们会着重强调这一点。单单是数据描述并不能为人们制订行动计划提供足够的依据,你必须用你的这些历史数据建立一个预言模型,然后再用另外一些数据对这个模型进行测试。一个好的模型没必要与数据库中的数据100%的相符(城市交通图也不是完全的实际交通线路的等比缩小),但他在你做决策时是一个很好的指南和依据。最后一步是验证你的模型。比如你用所有对你的产品推广计划做出回应的人的数据库做了一个模型,来预测什么样的人会对你的产品感兴趣。你能在得到这个模型后就直接利用这个模型做出决策或采取行动吗?还是更稳妥一点先对一小部分客户做一个实际的测试,然后再决定?2、数据挖掘:不能干什么注意数据挖掘中得到的预言模型并不会告诉你一个人为什么会做一件事、采取某个行动,他只会告诉你他会这样做,为什么要人去考虑。比如,数据挖掘可能会告诉你,如果这个人是男的、年收入在5万到6万之间,那么他可能会买你的商品/服务。你可能会利用这条规则,集中向这类人推销你的商品而从中获益,但是数据挖掘工具不会告诉你他们为什么会买你的东西,也不能保证所有符合这条规则的人都会买。为了保证数据挖掘结果的价值,你自己必须了解你的数据,这一点至关重要。输入数据库中的异常数据、不相关的字段或互相冲突的字段(比如年龄和生日不一致)、数据的编码方式等都会对数据挖掘输出结果的质量产生影响。虽然一些算法自身会对上面提到的这些问题做一些考虑,但让算法自己做所有这些决定是不明智的。数据挖掘不会在缺乏指导的情况下自动的发现模型。你不能这样对数据挖掘工具说,“帮我提高直接邮件推销的响应率”,你应该让数据挖掘工具找(1)对你的推销回应的人,或(2)即回应又做了大量订单的人的特征。在数据挖掘中寻找这两种模型是很不相同的。虽然数据挖掘工具使你不必再掌握艰深的统计分析技术,但你仍然需要知道你所选用的数据挖掘工具是如何工作的,他所采用的算法的原理是什么。你所选用的技术和优化方法会对你的模型的准确度和生成速度产生很大影响。数据挖掘永远不会替代有经验的商业分析师或管理人员所起的作用,他只是提供一个强大的工具。每个成熟的、了解市场的公司都已经具有一些重要的、能产生高回报的《数据库原理》拓展资源模型,这些模型可能是管理人员花了很长时间,作了很多调查,甚至是经过很多失误之后得来的。数据挖掘工具要做的就是使这些模型得到的更容易,更方便,而且有根据。3、数据挖掘和数据仓库大部分情况下,数据挖掘都要先把数据从数据仓库中拿到数据挖掘库或数据集市中。从数据仓库中直接得到进行数据挖掘的数据有许多好处。就如我们后面会讲到的,数据仓库的数据清理和数据挖掘的数据清理差不多,如果数据在导入数据仓库时已经清理过,那很可能在做数据挖掘时就没必要在清理一次了,而且所有的数据不一致的问题都已经被你解决了。数据挖掘库可能是你的数据仓库的一个逻辑上的子集,而不一定非得是物理上单独的数据库。但如果你的数据仓库的计算资源已经很紧张,那你最好还是建立一个单独的数据挖掘库。当然为了数据挖掘你也不必非得建立一个数据仓库,数据仓库不是必需的。建立一个巨大的数据仓库,把各个不同源的数据统一在一起,解决所有的数据冲突问题,然后把所有的数据导到一个数据仓库内,是一项巨大的工程,可能要用几年的时间花上百万的钱才能完成。只是为了数据挖掘,你可以把一个或几个事务数据库导到一个只读的数据库中,就把它当作数据集市,然后在他上面进行数据挖掘。4、数据挖掘和在线分析处理(OLAP)一个经常问的问题是,数据挖掘和OLAP到底有