【常见错误分析】ORA-01555错误解决一例

数据和云

发布于 2018-03-07 15:03:12

1.2K0

发布于 2018-03-07 15:03:12

文章被收录于专栏：数据和云

ORA-01555错误是一种在Oracle数据库中很常见的错误。尤其在Oracle 8i及之前的版本最多。从9i开始的undo自动管理，至现在的10g、11g中的undo auto tuning，使得ORA-01555的错误越来越少。但是这个错误，仍然不可避免。

ORA-01555错误的原因分析

1、SQL语句执行时间太长，或者UNDO表空间过小，或者事务量过大，或者过于频繁的提交，导致执行SQL过程中进行一致性读时，SQL执行后修改的前镜像（即UNDO数据）在UNDO表空间中已经被覆盖，不能构造一致性读块。

2、SQL语句执行过程中，访问到的块，在进行延迟块清除时，不能确定该块的事务提交时间与SQL执行开始时间的先后次序。

第1种情况，是最常见的。解决的办法无非就是增加UNDO表空间大小，优化出错的SQL，或者避免频繁地提交。

而第2种情况则是比第1种情况少很多。下面简单描述一下第2种情况发生的情景：

有事务大量修改了A表的数据，或者A表的数据虽然被事务少量修改，但是一部分修改过的块已经刷出内存并写到了磁盘上。随即事务提交，提交时刻为SCN1。而提交时有数据块上的事务没有被清除。
在SCN2时刻，开始执行SELECT查询A表，对A表进行全表扫描，而且A表很大。也可能是其他情况，比如是小表，但是是一个游标方式的处理过程，而处理过程中又非常耗时。

注意，这里SCN2与SCN1之间可能相隔了很远，从时间上来说，甚至可能有数十天。不管怎么样，这在SCN1至SCN2时间之间，系统中存在大量的事务，使得UNDO表空间的块以及UNDO段头的事务表全部被重用过。

ORACLE根据数据块中ITL的XID检查事务表，这时会有2种情况：

XID对应的事务表中的记录仍然存在并发现事务已经提交，可以得到事务准确的提交SCN（commit scn)，称为SCN3，等于SCN1。很显然，由于查询的时刻SCN2晚于事务提交的时刻SCN1，那么不需要构造一致性读块。
XID对应的事务表中的记录已经被重用，这个时候仍然表明表明事务已经被提交。那么这个时候，Oracle没办法准确地知道事务的提交时间，只能记录为这样一个事实，事务提交的SCN小于其UNDO段的事务表中最近一次重用的事务记录的SCN（即这个事务表最老的事务SCN）。这里称这个SCN为SCN4。
SCN4可能远小于SCN2，那是因为事务很早之前就已经提交。也可能SCN4大于SCN2，这是因为SELECT语句执行时间很长，同时又有大量的事务已经将事务表重用。对于后者，很显然，Oracle会认为该事务的提交时间可能在SELECT开始执行之后。这里为什么说可能，是因为ORACLE只能判断出事务是在SCN4之前提交的，并不是就刚好在SCN4提交。而此时，利用UNDO BLOCK进行一致性读数据的构造也很可能失败，因为UNDO BLOCK很可能已经被覆盖，特别是SCN1远小于SCN2的情况下。在这种情况下，ORA-01555错误就会出现。

对于上面最后一段，在SCN4大于SCN2的情况下，之后的描述，我提到了几个“可能”，是因为我对此也不能完全确定，Oracle是否还会有其他的方法来判断事务的提交时间早于SCN2。而我自己的模拟测试始终没有模拟出ORA-01555。

我的测试过程是这样子的：

1、修改表T1，注意T1表已经足够大，比如几十万行数据以上。

2、flush buffer_cache，使未提交的事务修改的块全部刷出内存。

3、提交事务。

4、使用大量的事务（注意这些事务不含表T1），将UNDO表空间填满并确保所有事务表已经被全部重用过。

5、写一段代码，以游标方式打开表T1，在游标的循环中使用dbms_lock.sleep故意增加时间。

6、同时多个JOB会话产生大量与表T1无关的事务，将UNDO表空间填满并确保所有事务表已经被全部重用过。

在我的期望中，上面的测试，对于游标处理部分，应该会报ORA-01555错误。但实际测试并没有出现，对于这类情形，看起来Oracle还有其他的机制来发现块上的事务提交时间早于查询开始时间。

虽然测试没有达到预期的结果，但是对于事务提交后块没有清除引起的ORA-01555错误，需要几个充分的条件：表足够大，表上的事务提交后有没有事务清除的块，对大表进行长时间的查询比如全表扫描，查询开始后有大量的事务填充和UNDO表空间和重用了事务表。

延迟块清除时引发01555错误

首先进行简单的环境介绍，运行在HP-UX环境下的Oracle 10.2.0.3，主机只有4颗比较老的PA-RISC CPU。这个系统的特点是大数据量的批量处理，基本上都是大数据量的插入。每个月的数据有单独的表，表一般都是在几十G以上，大的表超过100G。CPU利用率长期保持在100%。