MySQL分表实现上百万上千万记录分布存储的批量查询设计模式

本文介绍了一种针对MySQL中上百万乃至上千万条记录的分表存储和批量查询的设计模式。探讨了通过应用程序级别的实现和JDBC层实现的解决方案,以及MySQL 5.1 partition功能的局限性。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

原帖:

MySQL分表实现上百万上千万记录分布存储的批量查询设计模式
2006-11-15 23:55

MySQL分表实现上百万上千万记录分布存储的批量查询设计模式

Tim http://hi.baidu.com/jabber/blog/category/Mysql

我们知道可以将一个海量记录的 MySQL 大表根据主键、时间字段,条件字段等分成若干个表甚至保存在若干服务器中。
唯一的问题就是跨服务器批量查询麻烦,只能通过应用程序来解决。谈谈在Java中的解决思路。其他语言原理类似。

这里说的分表不是 MySQL 5.1 的 partition,而是人为把一个表分开存在若干表或不同的服务器。

1. 应用程序级别实现

见示意图


SelectThreadManager 分表数据查询管理器
它为分表的每个database or server 建立一个 thread pool

addTask() - 添加任务
stopTask() - 停止任务
getResult() - 获取执行结果

最快的执行时间 = 最慢的 MySQL 节点查询消耗时间
最慢的执行时间 = 超时时间

某个 ThreadPool 忙时候处理流程
1. 假如 ThreadPoolN 非常忙,(也意味 DB N 非常忙);
2. 新的查询任务到来,addTask(), 新的任务的一个thread加到ThreadPoolN任务排队中
3. 外层应用已经获得其他 thread 返回结果,继续等待
4. 外层应用等待超时的时间到,调用 stopTask() 设置该任务全部 thread 中的停止标志, 外层应用返回。
5. 若干时间后,ThreadPoolN取到该排队 Thread, 因为设置了停止位,线程直接运行完成。


2. JDBC 层实现
做一个 JDBC Driver 的包装,拦截 PreparedStatement, Statement 的 executeQuery()
然后调用 SelectThreadManager 完成

3. MySQL partition
MySQL 5.1 的 partition 功能由于单张表的数据跨文件,批量查询时候同样存在上述问题,不过它是在 MySQL 内部实现的,不需要外部调用者关心。其查询实现的原理应该大致类似。
但 partition 只解决了 IO 的瓶颈,并不能解决 CPU 计算的瓶颈,因此无法代替传统的手工分表方式。

类别:Mysql | 添加到搜藏 | 浏览( 1099)
 
最近读者:

 
<script type="text/javascript">document.write("<a href='http://passport.baidu.com/?login&tpl=sp&tpl_reg=sp&u="+myref+"' target='_self'>登录</a>后,您就出现在这里。");</script> 登录后,您就出现在这里。
好羊就好样
 
 
<script language="JavaScript" type="text/javascript"> allkey=allkey+"3c8bf3eddc140b4f78f05584_adc442ed647adad4b31cb11e_"; </script>
网友评论:
<script type="text/javascript"> function writecmt(type,id,cmtname,cmturl,portraitId){ var html1=""; if(type==1){ html1="
"+cmtname+"
"; }else{ if(cmtname=="" || cmtname=="匿名网友"){ if(cmturl==""){ html1=" 匿名网友"; }else{ html1=" "+cmtname+""; } }else{ if(cmturl==""){ html1="
网友: "+cmtname+"
"; }else{ html1="
网友: "+cmtname+"
"; } } } document.write(html1); } </script>
1
<script language="javascript" type="text/javascript"> writecmt(2,"3b78660661b3257b020881f3","Yimin","http://bantu.cn/blog","000059696d696e0000"); </script>
网友: Yimin
2006-11-16 11:41
受教了。 :)
 
2
<script language="javascript" type="text/javascript"> writecmt(2,"67485b43d4900d119313c6b7","rei","","00007265690000"); </script>
网友: rei
2006-12-12 21:41
仰慕啊~~
继续深入下去,你会发现你要做的其实是一个基于MySQL单点的分布式数据库中间件。
加油把~
 
3
<script type="text/javascript"> writecmt(1,"7e87985266e2b90e0df3e356","iso1600","http://hi.baidu.com/jabber","c8d769736f313630301801"); </script>
iso1600
2006-12-22 21:59
以上设计模式的程序其实我已经实现了,在10个数据库的环境下运行稳定。需要补充的是:int addTask()要返回一个taskID, getResult(int taskID)要传入一个taskID。90%以上的情况所有线程不会超时。每个线程执行完之后会用nofity()通知 getResult的主线程,所以当所有线程执行完之后主线程会立即被唤醒并返回结果,否则主线程会wait()到超时(设置为1s)。只不过现在是基于Java语言的,如果实现了跨语言,那就是一个分布式的中间件了。不过现在开发完成的功能已经满足了项目的需要,所以目前还缺少继续深入的动力。:)
 
5
<script language="javascript" type="text/javascript"> writecmt(2,"8c82ba114004ad7fca80c4ed","今晚打老虎","","0000bdf1cdedb4f2c0cfbba20000"); </script>
网友: 今晚打老虎
2007-02-06 23:09
请问有没有php的代码可以借来参考一下呢?最近在开发一个广告统计系统,由于数据量太大,所以需要分表,分表以后总统计有点困难,对数据库中间件不是很在行,请高手指教
 
6
<script language="javascript" type="text/javascript"> writecmt(2,"a6b8af86e00f623f67096eed","今晚打老虎","mailto:huzhuolei@gmail.com","0000bdf1cdedb4f2c0cfbba20000"); </script>
网友: 今晚打老虎
2007-02-06 23:10
忘了留邮箱了,呵呵
评论 3
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值