故障恢复:从未知错误ORA-600 [3712]以猜测推理达成恢复

李真旭

Oracle ACE,云和恩墨技术专家

个人博客:www.killdb.com

在Oracle数据库的日常维护中,我们可能经常会遇到一些从未见过的错误,甚至莫名其妙的错误。很多时候,甚至通过metalink、baidu、甚至google 都无法搜索到相关内容。这不,昨天公司南区同事让帮忙恢复的的一个客户数据库;据说是归档数据库,没有备份,重启实例后就无法打开数据库了。

我也是第一次听说这种事情,看了下居然是Oracle 11.2.0.3的数据库,还有这样起码的事情,确实有点匪夷所思。首先我们来看下是报错是什么样的。

看到这个错误。我感觉有一定似曾相识的感觉,但是有又说不来具体是什么错误。不过从错误号来看,我可以大致判断跟什么内容有关系。这里我拓展一下,对于Oracle ora-00600 错误,metalink有一篇详细的文档描述,里面对600错误后面的错误编号进行了分类。对于该文档大家务必了解下。所以现在即使我从未见过的ora-00600错误,我仍然可以第一眼就能大致判断是哪方面的问题。这里列举下:

从描述来看,我们可以大致判断,该错误肯定跟redo 有关系。

我们再回头去看下alert log的信息,可以看到一行比较关键的信息:

crash recovery due to error 600.

对于Oracle 数据库的open过程,我们知道需要经过nomount–mount–open这样几个过程,如果是异常关机例如强制abort的情况,那么open数据库时,Oracle 需要进行instance recovery;实际上我查询v$Log 也可以发现current redo logfile 的next_change# 为无穷大.

首先我尝试手工进行了一次recover database,没有任何问题,然后alter database open还是报上面的3712错误。这里我发现一个问题,所有的scn都已经变化,而且更新到了一致的状态。但是为啥还是报错呢?

我们知道其实Oracle open的时候不仅仅是需要去进行实例恢复,实例恢复完成后,需要顺利open数据库。如果我们试想是否存在这样一种场景:

假设当前我们恢复的数据库scn已经到了100000,然而实例恢复完成后open时发现下一个要更新的scn比当前的要小(比如99999),会怎么样呢? 很明显这是会报错的。

很多人或许看不懂,甚至不理解我为什么会这样设想,这里主要有2个因素:

1、 基于对于数据库原理的基本理解,深入了解oracle数据库open的过程 2、细心观察上述的ORA-00600 错误.

ok,就拿这个错误来讲 [3371],[612688841],[3371],[612688840];当我们看到这一串数字的时候,我们应该认为或者试想这写数字都是什么含义 ?

根据我们的数据库理解和经验来判断,通常都是表示序列,dba地址,文件号,scn等等这些。

我想,稍微有一点常识的人可能都能看出来,这里应该是表示的SCN。或许有人说为什么这里会是表示的scn呢?

如果这样想,那说明你不了解Oracle scn的基本结构。Oracle 中的scn,分为高位和低位两部分组成。大致上如下:

scn最低值是0×0000.00000000,最高值是0xffff.ffffffff。 高位是scn wrap,即0×0000,低位是scn base,即后面的8个位。 正确的SCN应该是=scn warp * power(2,32)+scn base

能够想到这里,我想我们可以大致判断这里的3371 应该是scn wrap值,而后面的612688841应该是scn base。将scn换算一下然后和文件头的最新scn进行比较,发现完全符合。这里能够验证我们的判断。

到这里,我们可以发现一个问题,scn不对啊? 为什么不对? 因为这里出现了2个scn,分别是:

3371*power(2,32)+612688841 和 3371*power(2,32)+612688840

很明显,这2个值大小不同,我想Oracle 肯定是进行判断,发现即将产生的scn比我们当前的scn还要小,才会出现这个情况。那么后面要小的scn就是有问题的scn。而这个scn 比如来源于控制文件。

想到这里,我就知道,我应该如何去完美解决这个问题了。那么答案就是重建控制文件。

如下是恢复的基本步骤,重建控制文件的步骤就不再描述了。

产生重建控制文件的脚本后,重建控制文件,记得noresetlogs 方式去创建即可(rac环境需要修改cluster_database=false);创建完毕后直接recover一把,然后顺利open数据库,完美收工!

补充:

1、后面我查询发现这极有可能是Oracle 11.2.0.3的bug:

Bug 16432211 : ORA-00600 [KCRFNL_3], LGWR… TERMINATING THE INSTANCE, ORA-00600 [3712]

后面我查询之前的alert log和trace 发现基本上完全一致。

原文发布于微信公众号 - 数据和云(OraNews)

原文发表时间:2016-04-29

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏北京马哥教育

Python老司机带你快速搞定日志分析工具

转载自:Python中文社区 ID:python-china 日志分析在web系统中故障排查、性能分析方面有着非常重要的作用。该工具的侧重点不是通常的P...

2615
来自专栏欧阳大哥的轮子

论MVVM伪框架结构和MVC中M的实现机制

一直都有人撰文吹捧MVVM应用开发框架,文章把MVVM说的天花乱坠并且批评包括iOS和android所用的MVC经典框架。这篇文章就是想给那些捧臭脚的人们泼泼冷...

713
来自专栏黑白安全

通过F5获取服务器真实内网IP

渗透测试过程中,经常会遇到目标服务器使用F5 LTM做负载均衡。 如果能获取到目标服务器的真实IP地址,会给后续渗透带来一定便利。

804
来自专栏听雨堂

Python学习笔记(2):数据库访问

本来打算继续用Access的,但费了非常大的劲,还是没有搞定。回过头,发现使用sqlite,简单到令人发指。干脆,把C#的CommonCode往这边迁移,先把A...

18510
来自专栏编程

左手用R右手Python系列——使用多进程进行任务处理

数据抓取中的密集任务处理,往往会涉及到性能瓶颈,这时候如果能有多进程的工具来进行支持,那么往往效率会提升很多。 今天这一篇分享在R语言、Python中使用调用多...

1978
来自专栏程序人生

思考,快与慢

吐槽:GitBook editor 有个二B的设计-当它莫名检测出文件被外星人修改后,会弹个无法取消的对话框-检测出外部修改,ignore? discard? ...

2727
来自专栏程序人生

再谈 API 的撰写 - 架构

在 再谈 API 的撰写 - 总览 里我们谈到了做一个 API 系统的基本思路和一些组件的选型,今天谈谈架构。 部署 首先要考虑的架构是部署的架构。部署的方案往...

3507
来自专栏腾讯移动品质中心TMQ的专栏

【腾讯TMQ】和开发一起写代码,让测试左移起来

软件工程中有提到测试人员越早的介入到研发的流程当中,就可以越早的发现问题,从而降低发现问题的成本。因此"左移"变得非常的有必要了起来,当然左移的方式有很多,例如...

2480
来自专栏北京马哥教育

图解OS和Linux的基础知识

“试着尽量用图示来表示个人对内容的理解,不足之处,还望不吝指教。” 一. CPU 1. cpu与指令集 CPU分为运算器和控制器 CPU指令 特权指令 拥有管...

2583
来自专栏Albert陈凯

Spark开发电商日志分析用户行为聚合功能练习下面开始搭建开发环境注意Task表中最后一个列task_param中,Json的StartDate和EndDate需要设置成今天,因为mock数据的时候,

项目介绍 ? 项目介绍 电商网站的各种用户行为进行分析 访问首页 → 点击商品 → 添加购物车 → 结算 访问首页 → 输入关键词 → 点击商品列表 → 点击...

4349

扫描关注云+社区