MySQL中的随机抽取如何实现

60次阅读
没有评论

共计 1730 个字符,预计需要花费 5 分钟才能阅读完成。

今天丸趣 TV 小编给大家分享一下 MySQL 中的随机抽取如何实现的相关知识点,内容详细,逻辑清晰,相信大部分人都还太了解这方面的知识,所以分享这篇文章给大家参考一下,希望大家阅读完这篇文章后有所收获,下面我们一起来了解一下吧。

1. 引言

现在有一个需求是从一个单词表中每次随机选取三个单词。

这个表的建表语句和如下所示:

mysql  Create table  words (  id  int(11) not null auto_increment;
  word  varchar(64) default null;
 primary key (id)
) ENGINE=InnoDB;

然后我们向其中插入 10000 行数据。接下来我们看看如何从中随机选择 3 个单词。

2. 内存临时表

首先,我们通常会想到用 order by rand()来实现这个逻辑:

mysql  select word from words order by rand() limit 3;

虽然这句话很简单,但是执行流程则比较复杂。我们使用 explain 来看看语句的执行情况:

Extra 字段中 Using temporary 表示需要使用临时表,Using filesort 表示需要进行排序。也就是需要进行排序操作。

对于 InnoDB 表来说,执行全字段排序能够减少对于磁盘的访问,所以会被优先选择。

而对于内存表来说,回表过程只是简单地根据数据行的位置,直接访问内存得到数据,根本不会导致多访问磁盘。所以这时 MySQL 会优选选择 rowid 排序。

我们接下来再来梳理下这条语句的执行流程:

创建一个临时表,这个表使用 memory 引擎,表里有两个字段,第一个字段是 double 类型,记为 R,第二个字段是 varchar(64)类型,记为 W。并且这个表没有索引。

从 words 表中,按主键顺序取出所有的 word。对于每个 word,调用 rand()函数随机生成一个大于 0 小于 1 的随机小数,并把这个随机小数和 word 分别存入临时表的 R 和 W 字段中。

接下来就是按照字段 R 进行排序

初始化 sort_buffer。sort_buffer 有两个字段,一个是 double 类型,另一个是整型。

从内存临时表中一行行取出 R 值和位置信息,分别存入 sort_buffer 的两个字段里。

sort_buffer 按照 R 值进行排序

排序完成后,取出前三个结果的位置信息,到内存临时表中取出相应的 word,返回给客户端。

流程示意图如下所示:

上面讲的位置信息,其实就是行所在的位置,也就是我们之前说的 rowid。

对于 InnoDB 引擎来说,对于有没有主键表来说有两种处理方式:

对于有主键的 InnoDB 表来说,这个 rowid 就是主键 id

对于没有主键的 InnoDB 表来说,这个 rowid 是由系统生成的,用来标识不同行。

因此,order by randn()使用了内存临时表,内存临时表的排序方法用的是 rowid 排序方法。

3. 磁盘临时表

不是所有的临时表都是内存临时表。tmp_table_size 这个配置限制了内存临时表的大小,如果超过了这个大小,就会使用磁盘临时表。InnoDB 引擎就是默认使用磁盘临时表。

4. 优先队列排序算法

在 MySQL5.6 之后,引入了优先队列排序算法,这种算法是不需要使用临时文件的。而原本的归并排序算法则是需要使用临时文件。

因为当你使用归并算法的时候,其实你只需要得到前 3,但是你是用完归并排序,那已经整体有序了,造成了资源的浪费。

而优先队列排序算法则可以只取到前三,执行流程如下:

对于这 10000 个准备排序的(R,rowid),先取前三行,构造成一个堆,并且将最大的值放在堆顶;

取下一行(R rsquo;,rowid rsquo;),跟当前堆里面最大的 R 比较,如果 R rsquo; 小于 R,则把 (R,rowid) 从堆中去掉,换成(R rsquo;,rowid rsquo;)。

不断重复上面的过程。

流程如下图所示:

但是当 limit 的数比较大时,维护堆比较困难,所以又会使用归并排序算法。

以上就是“MySQL 中的随机抽取如何实现”这篇文章的所有内容,感谢各位的阅读!相信大家阅读完这篇文章都有很大的收获,丸趣 TV 小编每天都会为大家更新不同的知识,如果还想学习更多的知识,请关注丸趣 TV 行业资讯频道。

正文完
 
丸趣
版权声明:本站原创文章,由 丸趣 2023-07-13发表,共计1730字。
转载说明:除特殊说明外本站除技术相关以外文章皆由网络搜集发布,转载请注明出处。
评论(没有评论)