October 1, 2015

大数据量的存储分表常见算法

By Gideon Php / Pear / Mysql / Node.js 0 Comments

当一个应用的数据量大的时候，我们用单表和单库来存储会严重影响操作速度，如mysql的myisam存储，我们经过测试，200w以下的时候，mysql的访问速度都很快，但是如果超过200w以上的数据，他的访问速度会急剧下降，影响到我们webapp的访问速度，而且数据量太大的话，如果用单表存储，就会使得系统相当的不稳定，mysql服务很容易挂掉。所以当数据量超过200w的时候，建议系统工程师还是考虑分表.

以下是几种常见的分表算法。

1.按自然时间来分表/分库;

如一个应用的数据在一年后数据量会达到200w左右，那么我们就可以考虑用一年的数据来做为一个表或者库来存储，例如，表名为app，那么2010 年的数据就是app_2010，app_2011;如果数据量在一个月就达到了200w左右，那么我们就可以用月份来分，app_2010_01，app_2010_02.

2.按数字类型hash分表/分库;

如果我们要存储用户的信息，我们应用的注册量很大，我们用单表是不能满足存储需求的，那么我们就可以用用户的编号来进行hash，常见的是用取余操作，如果我们要分30张表来存储用户的信息，那么用户编号为1的用户1%30=1，那么我们就存在user_01表里，如用户的编号为500，那么 500%30=20，那么我们就将此用户的信息存储在user_20的表里.

3.按md5值来分表/分库;

我们假设要存储用户上传的文件，如果上传量大的话，也会带来系统的瓶颈问题，我们做过试验，在一个文件夹下如果超过200个文件的话，文件的浏览效率会降低，当然，这个不属于我们本文讨论的范围，这块也要做散列操作.我们可以用文件的用户名来md5或者用文件的md5校验值来做，我们就可以用md5 的前5位来做hash，这样最多我们就可以得到5^5=3125个表，每次在存储文件的时候，就可以用文件名的md5值的前5位来确定这个文件该存那张表.

4.实例:某微博的url加密算法和存储策略的猜想.

现在好多微博都用这样的url来访问，如果他们的域名为www.example.com，那么如果你发微博的时候，你会发现你所发的url都变成了 http://t.cn/Mx4ja1，这样的形式，他们是怎么进行这样的转换呢?我猜想就是用到了我们上面讲的md5的存储和查找规则，用你发的url 来进行md5，得到md5值之后，如我们例子来说，就会用前6位来进行分表.

5.分表所带来的问题.

分表也会带来一系列的问题，如分页的实现，统计的实现，如果我们要做一个所有数据的分页，那么我们得每张表都得遍历一遍，这样访问效率会很低下.之前我尝试过用mysql的代理来实现，最终用tcsql来实现了.

6.分表算法的选择.

首先，分表适合于没有大的列表的应用来使用，要不然，会为这部分做好多额外的工作，如果你的应用数据量不是特别大的话，最好别用分表。呵呵，以前在做项目的时候，一项目经理要我们设计了一个千万级别的分表算法，而应用的pv不会超过100，总有点大炮打蚊子的感觉，而且因为分表，把整个项目的工期拖延了不少，得不偿失。

原文：http://www.360doc.com/content/11/0628/11/597197_130081429.shtml

本文：大数据量的存储分表常见算法

MySQL 查询时强制区分大小写
让MySQL搜索区分大小写或排序时分大小写方法如下： 1.在SQL中强制 SELECT `field` FROM `table` WHERE BINARY…
php程序员应具有的7种能力
php程序员应具有什么样的能力，才能更好的完成工作，才会有更好的发展方向呢？在中国我想您不会写一辈子代码的，那样不可能，过了黄金期，您又怎么办呢？看了本文后，希望对您有所帮助。一，php能力 1，了解阶段，您能写一些代码，因为那是在手册和google的帮助下，您才完成的。变量乱定义，N多函数不知道，做起事来很慢，想到什么写什么，代码写的比较乱，后期维护很麻烦。 2，熟悉阶段，经常查函数，手册估计也看过一，二遍了，常用的函数基本上您都了解了。后期维护给您带来了不少痛苦，您开始发现自己的代码有很多不足，开始思考如果改进自己的代码，如何站在项目的角度来规划自己的代码，而不是想到什么写什么，知道如何来减少冗余代码，使您的代码清晰，知道什么样的代码写出来让人看着舒服，基本的代码规范，已经形成。为了提高自己，会特意的去一些技术性的论坛，…
mysql数据库查询优化
上两周一直想办法提高查询速度，取得一点效果，解决了部分问题，记下来以便将来自己查看。由于公司没有专门的DBA，我自己对mysql数据库也不是很熟悉，而且这个JAVA开发的网络审计系统的管理系统，是经过了N多人几年时间的修修改改，今天到我们手里，要改成能支持大流量情况的版本，所以对我们这个只有几个人的JAVA组来说，确实是个难题。这个大流量的情况在以前的文章里也提到过，就是要支持每秒钟处理1G左右的网络数据包，HTTP协议的数据包最多，因此HTTP协议分析模块的流水日志表记录最大，据估算可能到达一天4000万条记录，采用一天一张表，那也是很大的，我看了.MYD文件大小，已经是8G多了。而我们管理系统查询日志记录时，对好几个字段都要进行条件查询，而且有几个字段长度达到256，在8G这么大的表里查询一个字符串，如果找不到，那必定从头要查到尾，速度慢得根本受不了。客户还要好几个字段一起设置条件来查询，这样基本上是二三十分钟都出不来，系统可用性极差。…

Just Code

大数据量的存储分表常见算法

About Author

Gideon

Add a Comment

Related Posts

Related Posts

About Author

Gideon

Add a Comment