前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >什么是外部排序?

什么是外部排序?

原创
作者头像
跋扈洋
修改2021-08-18 18:04:31
7270
修改2021-08-18 18:04:31
举报
文章被收录于专栏:物联网知识

外部排序的基本概念

在内存中进行的排序是内部排序,而在许多应用中,经常需要对大文件进行排序,因为文件中的记录很多、信息量庞大,无法将整个文件复制进内存中进行排序。因此,需要将待排序的记录存储在外存中,排序时再把数据一部分一部分地调入内存进行排序,在排序过程中需要多次进行内存和外存之间地交换。这种排序方法就称为外部排序。

  1. 外部排序指待排序文件较大,内存中一次性放不下,需存放在外存地文件地排序。
  2. 为减少平衡归并中外存读写次数所采取地方法:增大归并路数和减少归并段个数
  3. 利用败者树增大归并路数
  4. 利用置换-选择排序增大归并段长度来减少归并段个数
  5. 由长度不等地归并段,进行多路平衡归并,需要构造最佳归并树

外部排序的方法

文件通常是按块存储在磁盘上的,操作系统也是按块对磁盘上的信息进行读写的。因为磁盘读 / 写的机械动作所需的时间远远超过内存运算的时间(相对而言可以忽略不记),因此在外部排序过程中的时间代价主要考虑访问磁盘的次数,即I/O次数。 外部排序通常采用归并排序法。它包括两个相对独立的阶段:

  1. 根据内存缓冲区大小,将外存上的文件分成若干长度为t的子文件,依次读入内存并利用内部排序方法对他们进行排序,并将排序后得到的有序子文件重新写回外存,称这些有序子文件为归并段或顺串。
  2. 对这些归并段进行逐趟归并,是归并段逐渐由小到大,直至得到整个有序文件位置。

在外部排序中实现两两归并时,由于不可能将两个有序段及归并结果段同时存放在内存中,因此需要不停地将数据读出、写入磁盘,而这会耗费大量的时间。一般情况下: 外部排序的总时间 = 内存排序所需的时间 + 外存信息读取的时间 + 内部归并所需的时间 显然,外村信息读取地时间远大于内部排序和内部归并地的时间,因此应着力减少I/O次数。由于外村信息的读/写是以“磁盘块”为单位进行的,以8个归并段为例,可知每一趟归并需进行16次读和16次写,3趟归并并加上内部排序时所需进行的读/写,使得总共需进行128次读写。若改用4路归并排序,则只需2趟排序,外部排序时的总读写次数便减少为96。 因此增大归并路数可以减少归并趟数,进而减少总的磁盘I/O次数。

一般的,对r个初始归并段,做K路平衡归并。 K路平衡归并:

  1. 最多只能有k个段归并为一个
  2. 第一趟可将r个初始归并段归并为[r/k],以后每趟归并并将m个归并段归并成[m/k]个归并段,直至最后形成一个大的归并段位置。
  3. 树的高度 = [logkr]=归并趟数S。可见,只要增大归并路数k,或减少初始归并段个数r,都能减少归并趟数S,进而减少读写磁盘的次数,达到提高外部排序速度的目的。

后续

如果想了解更多物联网、智能家居项目知识,可以关注我的 #公众号:物联网知识。

编写不易,感谢支持。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 外部排序的基本概念
  • 外部排序的方法
  • 后续
相关产品与服务
云硬盘
云硬盘(Cloud Block Storage,CBS)为您提供用于 CVM 的持久性数据块级存储服务。云硬盘中的数据自动地在可用区内以多副本冗余方式存储,避免数据的单点故障风险,提供高达99.9999999%的数据可靠性。同时提供多种类型及规格,满足稳定低延迟的存储性能要求。
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档