首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >课前准备--蛋白质PDB文件与PDBQT文件的格式与区别

课前准备--蛋白质PDB文件与PDBQT文件的格式与区别

原创
作者头像
追风少年i
发布2026-08-10 09:06:12
发布2026-08-10 09:06:12
90
举报

作者,Evil Genius

接下来我们要准备生化小课了,这一次课程我们不再聚焦于基因组的内容,而是来到RNA的下游,蛋白组。

张雪峰其实说的很对,我们做事情第一目标不是如何赚钱,而是先把事情做好。学习最好的时代有两个阶段,1是学生时代,几乎没有后顾之忧,多学习一些技能作为储备;2就是编制内阶段,也没有后顾之忧,可以学习自己想做的事情。

工作了以后,很多事情就身不由己了,除非家底厚,不上班赚钱也可以。

这一篇我们来详细梳理一下PDB文件与PDBQT文件的格式。

蛋白质 PDB 文件的数据结构详解

PDB(Protein Data Bank)文件是描述蛋白质、核酸以及蛋白-配体复合物三维结构信息的标准文本格式。它是分子对接(AutoDock Vina)、分子动力学(GROMACS)、蛋白设计(PyRosetta)、结构预测分析等领域最基础的数据格式之一。

PDB 文件本质上是一个固定列宽(fixed-width)的文本文件,每一行代表一种结构信息。

典型 PDB 文件结构:

代码语言:javascript
复制
HEADER
TITLE
COMPND
SOURCE
SEQRES
ATOM
HETATM
TER
CONECT
END

其中最重要的是:

SEQRES:蛋白质一级序列

ATOM:蛋白质原子三维坐标

HETATM:非标准分子(配体、水、金属等)

CONECT:化学键连接信息

1. PDB 文件整体结构

一个典型蛋白 PDB 文件:

代码语言:javascript
复制
HEADER    TRANSCRIPTION FACTOR
TITLE     HUMAN PROTEIN STRUCTURE
COMPND    MOL_ID: 1;
COMPND    MOLECULE: P53 PROTEIN;
SOURCE    ORGANISM_SCIENTIFIC: HOMO SAPIENS;

SEQRES   1 A 393  MET GLU GLU GLY PRO GLY ...
SEQRES   2 A 393  ...

ATOM      1  N   MET A   1      12.560  13.345  10.223
ATOM      2  CA  MET A   1      13.220  14.512  10.850
ATOM      3  C   MET A   1      14.700  14.300  10.500
ATOM      4  O   MET A   1      15.300  13.200  10.700

...

HETATM 4500 ZN   ZN  B 500      20.300  15.200  13.500

CONECT 4500
END

2. HEADER —— 结构基本信息

格式:

代码语言:javascript
复制
HEADER    CLASSIFICATION DATE IDCODE

例如:

代码语言:javascript
复制
HEADER    HYDROLASE                         01-JAN-25   8ABC

含义:

字段

意义

HYDROLASE

蛋白功能类别

01-JAN-25

提交日期

8ABC

PDB ID

例如:

代码语言:javascript
复制
HEADER    OXIDOREDUCTASE                    15-MAY-24  7XYZ

表示:

蛋白属于氧化还原酶

PDB编号7XYZ

3. TITLE —— 结构名称

例如:

代码语言:javascript
复制
TITLE     CRYSTAL STRUCTURE OF HUMAN BRCA1 DOMAIN

描述:

实验对象

蛋白名称

结构类型

4. COMPND —— 分子组成信息

例如:

代码语言:javascript
复制
COMPND    MOL_ID: 1;
COMPND    MOLECULE: BRCA1 DNA REPAIR PROTEIN;
COMPND    CHAIN: A;

表示:

字段

含义

MOL_ID

分子编号

MOLECULE

蛋白名称

CHAIN

链编号

例如:

代码语言:javascript
复制
COMPND    CHAIN: A,B;

说明:

该结构包含两个蛋白链:

代码语言:javascript
复制
Chain A
Chain B

5. SOURCE —— 来源信息

例如:

代码语言:javascript
复制
SOURCE    ORGANISM_SCIENTIFIC: HOMO SAPIENS;

表示:

来源:

代码语言:javascript
复制
物种:
Human

常见:

SOURCE

含义

HOMO SAPIENS

MUS MUSCULUS

小鼠

ESCHERICHIA COLI

大肠杆菌

6. SEQRES —— 蛋白一级序列

SEQRES 保存完整氨基酸序列。

例如:

代码语言:javascript
复制
SEQRES   1 A  10  MET GLY SER LYS VAL LEU ASP GLU PHE TYR

解释:

代码语言:javascript
复制
SEQRES
   ↓
序列信息

1
↓
第1行

A
↓
蛋白链A

10
↓
总长度10 aa

对应:

代码语言:javascript
复制
M G S K V L D E F Y

三字母氨基酸代码

PDB使用:

PDB

单字母

ALA

A

VAL

V

LEU

L

GLY

G

ASP

D

GLU

E

LYS

K

ARG

R

PHE

F

7. ATOM —— 最核心的数据

ATOM记录蛋白质所有原子的三维坐标。

例如:

代码语言:javascript
复制
ATOM      1  CA  ALA A   5      10.235  15.223  20.553

固定列结构:

代码语言:javascript
复制
ATOM
123456789012345678901234567890123456789
ATOM      1  CA  ALA A   5      10.235  15.223  20.553

详细:

内容

1-6

ATOM

7-11

原子编号

13-16

原子名称

18-20

残基名称

22

链编号

23-26

残基编号

31-38

X坐标

39-46

Y坐标

47-54

Z坐标

55-60

占有率

61-66

B因子

8. 原子编号

例如:

代码语言:javascript
复制
ATOM      125

表示:

第125个原子。

蛋白:

一个氨基酸通常:

4个主链原子:

代码语言:javascript
复制
N
CA
C
O

例如丙氨酸:

代码语言:javascript
复制
N
CA
C
O
CB

5个原子。

9. 原子名称

例如:

代码语言:javascript
复制
ATOM      1  CA  GLY A   1

其中:

代码语言:javascript
复制
CA

表示:

α碳原子。

蛋白骨架:

代码语言:javascript
复制
O
      ||
N --- C --- Cα --- C
      |
      R

主要原子:

名称

意义

N

主链氮

CA

α碳

C

羰基碳

O

CB

β碳

10. 残基名称

例如:

代码语言:javascript
复制
ALA
GLY
VAL
LYS
ASP

代表氨基酸。

例如:

代码语言:javascript
复制
ATOM 1 CA LYS A 10

表示:

链A:

第10号氨基酸:

赖氨酸。

11. Chain(链)

蛋白复合物:

例如:

代码语言:javascript
复制
ATOM      1 CA ALA A 1
ATOM   2000 CA GLY B 1

表示:

代码语言:javascript
复制
Chain A
+
Chain B

常见:

意义

A

蛋白1

B

蛋白2

C

配体链

12. Residue ID(残基编号)

例如:

代码语言:javascript
复制
ALA A 100

表示:

链A

第100个氨基酸

注意:

PDB编号不一定连续:

例如:

代码语言:javascript
复制
1
2
3
5
6

可能缺失:

代码语言:javascript
复制
4

原因:

实验结构无法解析。

13. 三维坐标

核心:

代码语言:javascript
复制
X       Y       Z
10.235  15.223 20.553

单位:

代码语言:javascript
复制
Å (Angstrom)

换算:

代码语言:javascript
复制
1 Å = 10^-10 m

蛋白尺度:

蛋白直径 ≈ 30-100 Å

14. Occupancy(占有率)

例如:

代码语言:javascript
复制
0.50

表示:

该原子只有50%的概率处于该位置。

晶体结构:

通常:

代码语言:javascript
复制
1.00

表示:

完整观察。

15. B-factor(温度因子)

也叫:

代码语言:javascript
复制
Temperature factor

例如:

代码语言:javascript
复制
ATOM ... 25.5

表示:

原子运动程度。

低:

代码语言:javascript
复制
B=10

稳定区域

高:

代码语言:javascript
复制
B=80

柔性区域

结构质量判断:

B-factor

意义

稳定

动态

极高

可能错误

16. HETATM —— 非标准原子

用于:

代码语言:javascript
复制
配体
金属
水

例如:

代码语言:javascript
复制
HETATM 5000 O HOH A 300

小分子药物

代码语言:javascript
复制
HETATM 6000 C ATP A 400

金属

代码语言:javascript
复制
HETATM 7000 ZN ZN A 500

17. CONECT —— 化学键

例如:

代码语言:javascript
复制
CONECT 5000 5001

表示:

原子:

代码语言:javascript
复制
5000
|
5001

存在键。

通常:

蛋白内部键不写。

主要用于:

代码语言:javascript
复制
金属
配体
共价修饰

18. MODEL —— 多构象结构

NMR结构:

代码语言:javascript
复制
MODEL 1

ATOM...

ENDMDL


MODEL 2

ATOM...

ENDMDL

表示:

多个可能构象。

19. PDB结构层级关系

PDB数据实际上是:

代码语言:javascript
复制
Protein Structure
│
├── Chain
│     │
│     ├── Residue
│     │       │
│     │       └── Atom
│     │
│     └── Residue
│
└── Ligand
        │
        └── Atom

例如:

代码语言:javascript
复制
PDB
 |
 Chain A
 |
 Residue 100 Lys
 |
 Atom CA
 |
 Coordinate
 (10.2,15.3,20.1)

总结:PDB最重要的10个字段

字段

重要程度

用途

ATOM

★★★★★

蛋白三维坐标

HETATM

★★★★★

配体/金属

SEQRES

★★★★

完整序列

CHAIN

★★★★

区分亚基

RESID

★★★★

残基编号

XYZ坐标

★★★★★

空间位置

B-factor

★★★

结构柔性

Occupancy

★★

可靠性

CONECT

★★★

化学键

MODEL

★★

多构象

PDBQT 文件结构与 PDB 文件的区别详解

PDBQT 是在 PDB 文件基础上,为 AutoDock / AutoDock Vina 分子对接设计的专用格式。

简单理解:

PDB = 描述蛋白质三维结构的通用格式

PDBQT = 为分子对接增加了“电荷 + 原子类型 + 可旋转键信息”的PDB增强格式

关系

代码语言:javascript
复制
PDB
 |
 | 添加
 | 
 ├── Partial charge(部分电荷)
 ├── AutoDock atom type(Vina原子类型)
 ├── Torsion information(可旋转键)
 |
 ↓
PDBQT

1. PDB 与 PDBQT核心区别

内容

PDB

PDBQT

用途

结构存储

分子对接

主要软件

PyMOL、PyRosetta、GROMACS

AutoDock、AutoDock Vina

坐标

残基信息

链信息

原子编号

B-factor

×(通常不用)

Occupancy

×(通常不用)

部分电荷

×

AutoDock原子类型

×

可旋转键

×

力场参数

×

×

2. PDB 文件 ATOM结构

PDB:

代码语言:javascript
复制
ATOM      1  CA  ALA A   1      12.345  15.678  20.111  1.00 20.50

格式:

代码语言:javascript
复制
ATOM
 |
 原子编号
 |
 原子名称
 |
 氨基酸
 |
 链
 |
 残基编号
 |
 X Y Z 坐标
 |
 occupancy
 |
 B-factor

例如:

代码语言:javascript
复制
ATOM      1  CA  ALA A   1      12.345 15.678 20.111

表示:

代码语言:javascript
复制
Chain A
Residue 1
Alanine
Alpha carbon
坐标:
(12.345,15.678,20.111)

3. PDBQT ATOM结构

PDBQT:

代码语言:javascript
复制
ATOM      1  CA  ALA A   1      12.345 15.678 20.111  0.123 C

增加:

代码语言:javascript
复制
0.123
 |
Partial charge

C
 |
AutoDock atom type

结构:

代码语言:javascript
复制
ATOM
 |
 原子编号
 |
 原子名称
 |
 残基
 |
 链
 |
 坐标
 |
 电荷
 |
 原子类型

4. PDBQT增加的两个关键内容

4.1 Partial Charge(部分电荷)

PDB:

没有电荷:

代码语言:javascript
复制
C
O
N

PDBQT:

例如:

代码语言:javascript
复制
C  0.123
O -0.345
N -0.278

含义:

原子电子分布。

例如:

羰基:

代码语言:javascript
复制
C=O

C:
+0.5

O:
-0.5

Vina利用电荷计算:

静电作用

氢键

4.2 AutoDock Atom Type

PDB:

只知道:

代码语言:javascript
复制
C
N
O
S

PDBQT:

进一步分类:

例如:

PDB元素

AutoDock类型

C

C

O

OA

N

NA

H

HD

S

SA

Cl

Cl

例如:

氧:

普通氧:

代码语言:javascript
复制
O

氢键受体氧:

代码语言:javascript
复制
OA

氮:

普通氮:

代码语言:javascript
复制
N

供氢氮:

代码语言:javascript
复制
NA

5. PDBQT中的ROOT / BRANCH

这是配体最重要的区别。

蛋白:

一般:

代码语言:javascript
复制
没有ROOT

配体:

有:

代码语言:javascript
复制
ROOT
 |
 可旋转结构
 |
 BRANCH

例如:

代码语言:javascript
复制
ROOT

ATOM      1 C1  LIG
ATOM      2 C2  LIG

BRANCH 1 5

ATOM      5 C3 LIG

ENDBRANCH

ENDROOT

表示:

代码语言:javascript
复制
固定部分
 |
 C-C
 |
 可旋转键
 |
 侧链运动

6. 为什么PDB没有旋转键?

PDB只保存:

某一个瞬间结构

例如:

蛋白:

静态结构

但是Vina:

需要搜索:

配体不同构象

例如:

乙醇:

代码语言:javascript
复制
CH3-CH2-OH

C-C键可以旋转:

构象1

代码语言:javascript
复制
CH3
 |
CH2-OH

构象2

代码语言:javascript
复制
CH3
     \
      CH2-OH

Vina需要知道:

哪些键可以动。

7. 蛋白PDBQT vs 配体PDBQT

这是很多初学者容易混淆的地方。

蛋白PDBQT

特点:

代码语言:javascript
复制
Rigid
固定

例如:

代码语言:javascript
复制
ATOM
ATOM
ATOM

END

没有:

代码语言:javascript
复制
ROOT
BRANCH

原因:

对接时:

蛋白通常保持刚性。

配体PDBQT

特点:

代码语言:javascript
复制
Flexible
可旋转

包含:

代码语言:javascript
复制
ROOT
BRANCH
TORSDOF

例如:

最后:

代码语言:javascript
复制
TORSDOF 5

表示:

5个自由旋转键。

8. PDB → PDBQT转换流程

蛋白

代码语言:javascript
复制
protein.pdb

↓

AutoDockTools

↓

protein.pdbqt

增加:

极性氢

电荷

原子类型

配体

代码语言:javascript
复制
ligand.sdf/mol2

↓

OpenBabel

↓

ligand.pdb

↓

AutoDockTools

↓

ligand.pdbqt

增加:

rotatable bonds

charge

9. PDBQT实例比较

PDB

代码语言:javascript
复制
ATOM      5  O   SER A  10
          12.33 15.22 18.55

信息:

代码语言:javascript
复制
氧原子
Serine
坐标

PDBQT

代码语言:javascript
复制
ATOM      5  O   SER A 10
          12.33 15.22 18.55
          -0.35 OA

增加:

代码语言:javascript
复制
-0.35
 |
电荷


OA
 |
氢键受体氧

生活很好,有你更好。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 作者,Evil Genius
  • 接下来我们要准备生化小课了,这一次课程我们不再聚焦于基因组的内容,而是来到RNA的下游,蛋白组。
  • 张雪峰其实说的很对,我们做事情第一目标不是如何赚钱,而是先把事情做好。学习最好的时代有两个阶段,1是学生时代,几乎没有后顾之忧,多学习一些技能作为储备;2就是编制内阶段,也没有后顾之忧,可以学习自己想做的事情。
  • 工作了以后,很多事情就身不由己了,除非家底厚,不上班赚钱也可以。
  • 这一篇我们来详细梳理一下PDB文件与PDBQT文件的格式。
  • 蛋白质 PDB 文件的数据结构详解
  • PDB(Protein Data Bank)文件是描述蛋白质、核酸以及蛋白-配体复合物三维结构信息的标准文本格式。它是分子对接(AutoDock Vina)、分子动力学(GROMACS)、蛋白设计(PyRosetta)、结构预测分析等领域最基础的数据格式之一。
  • PDB 文件本质上是一个固定列宽(fixed-width)的文本文件,每一行代表一种结构信息。
  • 典型 PDB 文件结构:
  • 其中最重要的是:
  • SEQRES:蛋白质一级序列
  • ATOM:蛋白质原子三维坐标
  • HETATM:非标准分子(配体、水、金属等)
  • CONECT:化学键连接信息
  • 1. PDB 文件整体结构
  • 一个典型蛋白 PDB 文件:
  • 2. HEADER —— 结构基本信息
  • 格式:
  • 例如:
  • 含义:
  • 例如:
  • 表示:
  • 蛋白属于氧化还原酶
  • PDB编号7XYZ
  • 3. TITLE —— 结构名称
  • 例如:
  • 描述:
  • 实验对象
  • 蛋白名称
  • 结构类型
  • 4. COMPND —— 分子组成信息
  • 例如:
  • 表示:
  • 例如:
  • 说明:
  • 该结构包含两个蛋白链:
  • 5. SOURCE —— 来源信息
  • 例如:
  • 表示:
  • 来源:
  • 常见:
  • 6. SEQRES —— 蛋白一级序列
  • SEQRES 保存完整氨基酸序列。
  • 例如:
  • 解释:
  • 对应:
  • 三字母氨基酸代码
  • PDB使用:
  • 7. ATOM —— 最核心的数据
  • ATOM记录蛋白质所有原子的三维坐标。
  • 例如:
  • 固定列结构:
  • 详细:
  • 8. 原子编号
  • 例如:
  • 表示:
  • 第125个原子。
  • 蛋白:
  • 一个氨基酸通常:
  • 4个主链原子:
  • 例如丙氨酸:
  • 5个原子。
  • 9. 原子名称
  • 例如:
  • 其中:
  • 表示:
  • α碳原子。
  • 蛋白骨架:
  • 主要原子:
  • 10. 残基名称
  • 例如:
  • 代表氨基酸。
  • 例如:
  • 表示:
  • 链A:
  • 第10号氨基酸:
  • 赖氨酸。
  • 11. Chain(链)
  • 蛋白复合物:
  • 例如:
  • 表示:
  • 常见:
  • 12. Residue ID(残基编号)
  • 例如:
  • 表示:
  • 链A
  • 第100个氨基酸
  • 注意:
  • PDB编号不一定连续:
  • 例如:
  • 可能缺失:
  • 原因:
  • 实验结构无法解析。
  • 13. 三维坐标
  • 核心:
  • 单位:
  • 换算:
  • 蛋白尺度:
  • 蛋白直径 ≈ 30-100 Å
  • 14. Occupancy(占有率)
  • 例如:
  • 表示:
  • 该原子只有50%的概率处于该位置。
  • 晶体结构:
  • 通常:
  • 表示:
  • 完整观察。
  • 15. B-factor(温度因子)
  • 也叫:
  • 例如:
  • 表示:
  • 原子运动程度。
  • 低:
  • 稳定区域
  • 高:
  • 柔性区域
  • 结构质量判断:
  • 16. HETATM —— 非标准原子
  • 用于:
  • 例如:
  • 小分子药物
  • 金属
  • 17. CONECT —— 化学键
  • 例如:
  • 表示:
  • 原子:
  • 存在键。
  • 通常:
  • 蛋白内部键不写。
  • 主要用于:
  • 18. MODEL —— 多构象结构
  • NMR结构:
  • 表示:
  • 多个可能构象。
  • 19. PDB结构层级关系
  • PDB数据实际上是:
  • 例如:
  • 总结:PDB最重要的10个字段
  • PDBQT 文件结构与 PDB 文件的区别详解
  • PDBQT 是在 PDB 文件基础上,为 AutoDock / AutoDock Vina 分子对接设计的专用格式。
  • 简单理解:
  • PDB = 描述蛋白质三维结构的通用格式
  • PDBQT = 为分子对接增加了“电荷 + 原子类型 + 可旋转键信息”的PDB增强格式
  • 关系
  • 1. PDB 与 PDBQT核心区别
  • 2. PDB 文件 ATOM结构
  • PDB:
  • 格式:
  • 例如:
  • 表示:
  • 3. PDBQT ATOM结构
  • PDBQT:
  • 增加:
  • 结构:
  • 4. PDBQT增加的两个关键内容
  • 4.1 Partial Charge(部分电荷)
  • PDB:
  • 没有电荷:
  • PDBQT:
  • 例如:
  • 含义:
  • 原子电子分布。
  • 例如:
  • 羰基:
  • Vina利用电荷计算:
  • 静电作用
  • 氢键
  • 4.2 AutoDock Atom Type
  • PDB:
  • 只知道:
  • PDBQT:
  • 进一步分类:
  • 例如:
  • 例如:
  • 氧:
  • 普通氧:
  • 氢键受体氧:
  • 氮:
  • 普通氮:
  • 供氢氮:
  • 5. PDBQT中的ROOT / BRANCH
  • 这是配体最重要的区别。
  • 蛋白:
  • 一般:
  • 配体:
  • 有:
  • 例如:
  • 表示:
  • 6. 为什么PDB没有旋转键?
  • PDB只保存:
  • 某一个瞬间结构
  • 例如:
  • 蛋白:
  • 静态结构
  • 但是Vina:
  • 需要搜索:
  • 配体不同构象
  • 例如:
  • 乙醇:
  • C-C键可以旋转:
  • 构象1
  • 构象2
  • Vina需要知道:
  • 哪些键可以动。
  • 7. 蛋白PDBQT vs 配体PDBQT
  • 这是很多初学者容易混淆的地方。
  • 蛋白PDBQT
  • 特点:
  • 例如:
  • 没有:
  • 原因:
  • 对接时:
  • 蛋白通常保持刚性。
  • 配体PDBQT
  • 特点:
  • 包含:
  • 例如:
  • 最后:
  • 表示:
  • 5个自由旋转键。
  • 8. PDB → PDBQT转换流程
  • 蛋白
  • 增加:
  • 极性氢
  • 电荷
  • 原子类型
  • 配体
  • 增加:
  • rotatable bonds
  • charge
  • 9. PDBQT实例比较
  • PDB
  • 信息:
  • PDBQT
  • 增加:
  • 生活很好,有你更好。
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档