蛋白质谱鉴定通常通过MS/MS谱图与数据库中的候选肽段进行匹配,完成蛋白序列归属。当目标蛋白缺少可用参考序列时,常规数据库检索可能无法形成可靠匹配。对于未知来源蛋白、非模式物种蛋白或样本特异序列,无数据库蛋白质测序可依据碎片离子信息解析肽段序列,为后续序列分析提供依据。数据库检索无匹配并非只与参考序列缺失有关,数据库范围、检索参数、序列变异和谱图质量也会影响匹配结果。不同原因对应的后续分析路径并不相同,方案设计需区分参考信息不足与检索条件限制。
一、数据库检索无匹配的来源判断
图1. 蛋白质谱数据库检索无匹配结果的主要原因及排查路径
1、参考数据库缺少目标蛋白序列
(1) 无参考序列或数据库注释不足
目标蛋白来源物种缺少完整注释,或蛋白来源尚不明确时,数据库中缺乏对应理论序列供MS/MS谱图匹配。de novo肽段测序能够依据碎片离子之间的质量差异推断氨基酸序列,并通过多个重叠肽段逐步扩展序列信息。
(2) 样本特异序列未被数据库收录
单氨基酸变异、特殊剪接形式等序列变化会造成实验肽段与通用数据库序列不一致。已有基因组、转录组或同源蛋白信息时,可建立与样本背景更匹配的候选序列库,也可利用de novo序列标签开展同源匹配。通用数据库缺少对应变异序列时,常规检索可能无法形成准确归属。
2、检索条件限制造成无匹配结果
(1) 数据库范围与检索参数影响谱图归属
数据库已经包含目标序列时,酶切特异性、修饰设置和检索范围仍会影响谱图匹配。检索设置与真实样本特征不一致,部分已有序列可能无法被识别。数据库选择和参数设置属于检索无匹配时的重要复核环节。
(2) 谱图质量限制序列匹配
MS/MS碎片离子数量不足、离子系列不连续或共碎裂干扰较强时,即使存在正确参考序列,也可能缺少支持可靠匹配的谱图证据。未匹配谱图是否具有连续且可解释的碎片离子,可作为判断de novo序列解析价值的重要依据。
二、根据参考信息选择从头测序路线
1、缺少可用参考序列时开展de novo肽段测序
(1) 从碎片离子获得局部肽段序列
de novo分析依据MS/MS碎片离子之间的质量差异推断肽段序列,不依赖预设蛋白数据库。未知蛋白或缺少可靠参考序列的非模式物种蛋白,可通过高质量碎片谱获得局部氨基酸序列证据。
(2) 多个肽段支持蛋白序列扩展
单条MS/MS谱图通常对应一个肽段,无法代表完整蛋白序列。蛋白层面的序列解析依赖多个肽段之间的覆盖和重叠。碎片离子覆盖不足时,部分结果仅能形成局部序列标签,序列连续性受到实际质谱证据限制。
2、已有近缘序列时采用同源辅助解析
(1) de novo序列标签用于同源匹配
目标蛋白缺少完全一致的数据库条目,但存在近缘物种或同源蛋白序列时,de novo序列标签可与相关参考序列进行比对。已有同源信息能够缩小候选范围,并为蛋白序列框架和差异区域定位提供参考。
(2) 差异区域依赖独立质谱证据
同源蛋白之间可能存在氨基酸替换、插入或缺失。与参考序列不一致的位置仍应依据实际碎片离子判断,不能直接使用同源序列填补缺乏质谱支持的区域。de novo证据与参考序列之间的关系应在结果解释中明确区分。
3、连续序列重建采用互补序列策略
(1) 互补酶切扩展肽段覆盖
单一酶切方式可能留下未覆盖区域。不同切割特异性的酶能够产生新的肽段组合,增加相邻序列之间的重叠,为长区段序列拼接提供更多实验依据。
(2) 互补碎裂增加局部序列信息
不同碎裂方式形成的离子信息具有一定互补性。单一碎裂模式下证据有限的区域,可通过额外碎裂信息扩展局部序列判断依据。互补酶切与碎裂策略能够增加序列证据,但不能预设整条蛋白均可形成连续覆盖。
图2. 无数据库蛋白质测序中基于参考信息和研究目标的策略选择
三、样本状态与结果目标影响方案深度
1、样本复杂度影响肽段归属
(1) 单一蛋白样本的序列归属相对明确
单一蛋白样本中的肽段来源较集中,de novo序列片段与目标蛋白之间的归属关系相对明确。研究目标涉及未知蛋白长区段或连续序列时,样本纯度会直接影响肽段归属和序列拼接。
(2) 混合样本增加序列解析难度
复杂样本包含多个蛋白来源的肽段。缺少参考数据库时,不同de novo序列片段之间的蛋白归属较难区分,其他蛋白来源的肽段也会增加序列拼接的不确定性。以特定未知蛋白为解析对象时,前期分离纯化状态是方案设计中的重要判断条件。
2、结果目标决定序列解析深度
(1) 局部序列确认与连续序列重建对应不同证据要求
研究目标为获得特征肽段或确认局部氨基酸序列时,高质量de novo肽段能够提供直接序列证据。研究任务涉及长区段或连续蛋白序列重建时,单一酶切提供的覆盖通常有限,互补酶切、不同碎裂信息及多个重叠肽段可用于扩展序列范围。
(2) 序列覆盖不能直接代表完整序列
从头测序获得的覆盖范围代表具有质谱证据支持的序列区域。部分肽段未检出、局部碎裂不足或等质量残基均可能造成序列空缺与局部歧义。结果解读应明确区分直接质谱证据、候选序列和未覆盖区域,避免将局部覆盖解释为整条蛋白序列已经确定。
数据库检索无法匹配蛋白时,方案判断应区分参考序列缺失与检索条件限制。数据库范围或参数设置造成的无匹配,可通过复核检索策略进一步确认;缺少可用参考序列或存在样本特异序列时,可依据样本纯度、已有序列背景和解析目标选择de novo测序、同源搜索、互补酶切或序列拼接路径。百泰派克生物科技可提供蛋白质从头测序及无数据库蛋白质测序相关检测与分析服务。针对未知蛋白序列解析、数据库检索无匹配或质谱结果难以归属的项目,可根据样本状态和序列解析目标评估后续测序方案。