77范文网 - 专业文章范例文档资料分享平台

UniProt:蛋白质的全信息数据库(2)

来源:网络收集 时间:2020-04-15 下载这篇文档 手机版
说明:文章内容仅供预览,部分内容可能不全,需要完整文档或者需要复制内容,请下载word后使用。下载word有问题请添加微信号:或QQ: 处理(尽可能给您提供完整文档),感谢您的支持与谅解。点击这里给我发消息

2002级生物技术系 王敏 学号021402167

有可识别的相象似性对象时申请(ORFans)。

ORFans的注释。 各种各样的预测工具已被用于和已知的蛋白质家族没有任何相似性的蛋白质的预测。可能的穿膜结构,信号序列,螺旋,ATP/GTP的结合位点, LPXTG 主题和确定的一些被定义重复一致的和从属性的标准自动注释,并且没有任何另外更进一步的手工证明。

描述详细的成员的注释的(附属)家族。属于描述详细的蛋白质(附属)的蛋白质家族可能自动地附注使用由相似性分配到原型手工附注的词条的规则系统来描述注释的程度和本质。这样的一个系统规则也包括仔细编辑(附属)家族的调整,这被用来传递来自一个模型入口的注释的特征和用来鉴定家族的新成员的形状特征的信息。限于生物化学的途径的特定种类的标准和规则被用来发展一个能够在整个蛋白质组的水平辨认出不同点的系统。

5、命名的标准化和词语的用法

一致的命名对通讯和文献检索是不可缺少的。 UniProt通过他的isoforms使给定的蛋白质和与其有关的生物命名标准化。对各种各样的其他UniProt 工程来说我们使用一些在UniProt 资料里被列举出来固定的词汇,例如组织,质粒和关键词。统一的UniProt关键字目录基于通过增加选择PIR关键词而增加的瑞士-Prot关键词,PIR关键词代表现存在于瑞士-Prot关键词的可能的新概念或者新亲子节点。如果可以得到,我们会利用仍然提供公用同义词的国际委员会所确定的官方命名。与其他数据库和组织的合作和定期的数据交流使得我们的命名的实现非常的及时和专业。

6、与其他数据库的融合

UniProt 也同时提供其他数据库的数据的引用对照,如提供脱氧核糖核酸序列信息的DDBJ / EMBL / GenBank核苷酸顺序数据库,2D和3D蛋白质结构数据库,各种各样的蛋白质结构域和家族描述数据库,PTM 数据库,专门物种的数据库,相异的数据库和疾病数据库,UniProt都提供这些数据库的入口。 因此,UniProt 几乎成为了超过50相互参照的数据库归档的生化信息中心的中心。 在一份UniProt的清单资料中

6

2002级生物技术系 王敏 学号021402167

(http://www.uniprot.org/support/docs/dbxref.shtml)包含了对每个数据库的简短的介绍和服务器地址。 这种通用性几乎已经通过专门数据库交叉引用(DR)实现了。 另外,从序列或者特别的致力于PTMs或突变的某些类型的数据库的站点的连接也可在UniProt中找到。根据特征窗口里的独特稳定的特征标识符(FTId)可以找到特殊位置的注释项目。 目前这些被系统归属于FT VARIANT序列入口的特异性行列、其它拼接事件(VARSPLIC)以及给定的

glycosylation 站点(CARBOHYD),但是将最后被分配到FT VARIANT的全部类型。

7、最小冗余

对一个给定的蛋白质序列,许多序列数据库包含有对应不同的文字报告的独立入口。 为了保证数据库的冗余减到最小,在UniProt里我们尽量设法合并所有的这些数据。由于接合变形, 多形性,引起疾病的突变,实验序列的修改或者简单的序列的错误在排序报告之间的差别也会在相应UniProt 入口中的特征窗口里被指示。

拼接isoforms之间也许有相当大不同,在isoforms之间的序列之间的相似的可能性可能小于50%。 那些可免费得到的VARSPLIC 工具使得UniProt的FT中的全部注释接合变形成为一种休闲,或为完整数据库。一个包含 Un iProt 注释的全部接合变形的FASTA 格式化的文件可被下载下来同那个相似性搜寻程序一起使用。

8、证据归因

UniProt 联合组织强调对蛋白质注释使用一个证据归因机制, 对于全部数据,包括数据源,注释的证据类型和方法。这是根本的,因为UniProt knowledgebase 将包含从基础的核苷酸序列数据库自动入口的数据,从其他数据库的入口的专用程序的数据,从自动注释系统得到的结果还有最重要的所有专家手工的修订。 证据标记的使用将使用户容易区别所有这些数据源和鉴定想要的特别种类的数据,例如用实验证明蛋白质的注释。

为了通过来源归因增加实验核实的数据数量用来更进一步改进蛋白质注释的质量,UniProt已经开发了一个参考目录提交系统和实施文字数据的摘要

7

2002级生物技术系 王敏 学号021402167

的归因。提交页允许实验注释的文字引用的提交和归类,并且为每个UniProt 入口显示许多收集修订数据库的综合目录数据。通过计算机帮助映射现有的蛋白质目录的信息,一个实验特征手工归因系统正在被执行实施。到目前为止,为了直接并网入nowledgebase UniProt已有几千个实验特征同有关出版物联系在一起并与那些对应PMIDs进行了相互对照。

参考文献

1. Boeckmann,B., Bairoch,A., Apweiler,R., Blatter,M.,

Estreicher,A., Gasteiger,E., Martin,M.J., Michoud,K., O’Donovan,C., Phan,I. et al. (2003) The Swiss-Prot protein knowledgebase and its supplement TrEMBL in 2003. Nucleic Acids Res., 31, 365–370.[Abstract/Free Full Text]

2. Wu,C.H., Yeh,L.-S.L., Huang,H., Arminski,L., Castro-Alvear,J., Chen,Y., Hu,Z., Kourtesis,P., Ledley,R.S., Suzek,B.E. et al. (2003) The Protein Information Resource. Nucleic Acids Res., 31, 345–347.[Abstract/Free Full Text]

3. Stoesser,G., Baker,W., van den Broek,A., Garcia-Pastor,M., Kanz,C., Kulikova,T., Leinonen,R., Lin,Q., Lombard,V., Lopez,R. et al. (2003) The EMBL Nucleotide Sequence Database: major new development.

Nucleic Acids Res., 30, 21–26.[CrossRef]

4. Hubbard,T., Barker,D., Birney,E., Cameron,G., Chen,Y., Clark,L., Cox,T., Cuff,J., Curwen,V., Down,T. et al. (2002) The Ensembl genome database project. Nucleic Acids Res., 30, 38–41.[Abstract/Free Full Text]

5. Westbrook,J., Feng,Z., Chen,L., Yang,H. and Berman,H. (2003) The Protein Data Bank and structural genomics. Nucleic Acids Res., 31, 489–491.[Abstract/Free Full Text]

8

2002级生物技术系 王敏 学号021402167

6. Pruitt,K. and Maglott,D. (2001) RefSeq and LocusLink: NCBI gene-centered resources. Nucleic Acids Res., 29, 137–140.[Abstract/Free Full Text]

7. FlyBase Consortium (2003) The FlyBase database of the Drosophila genome projects and community literature. Nucleic Acids Res., 31, 172–175.[Abstract/Free Full Text]

8. Harris,T., Lee,R., Schwarz,E., Bradnam,K., Lawson,D., Chen,W., Blasier,D., Kenny,E., Cunningham,F., Kishore,R. et al. (2003) WormBase: a cross-species database for comparative genomics. Nucleic Acids Res., 31, 133–137.[Abstract/Free Full Text]

9. Ashburner,M., Ball,C.A., Blake,J.A., Botstein,D., Butler,H., Cherry,J.M., Davis,A.P., Dolinski,K., Dwight,S.S., Eppig,J.T. et al. (2000) Gene Ontology: tool for the unification of biology. Nature Genet., 25, 25–29.[CrossRef][Medline]

10.

Mulder,N., Apweiler,R., Attwood,T., Bairoch,A., Barrell,D.,

Bateman,A., Binns,D., Biswas,M., Bradley,P., Bork,P. et al. (2003) The InterPro Database, 2003 brings increased coverage and new features.

Nucleic Acids Res., 31, 315–318.[Abstract/Free Full Text]

11.

Bateman,A., Birney,E., Cerruti,L., Durbin,R., Etwiller,L.,

Eddy,S.R., Griffiths-Jones,S., Howe,K.L., Marshall,M. and

Sonnhammer,E.L.L. (2002) The Pfam protein families database. Nucleic Acids Res., 30, 276–280.[Abstract/Free Full Text]

12.

Hulo,N., Sigrist,C.J.A., Le Saux,V., Langendijk-Genevaux,P.,

Bordoli,L., Gattiker,A., De Castro,E., Bucher,P. and Bairoch,A. (2004) Recent improvements to the PROSITE database. Nucleic Acids Res., 32, D134–D137.[Abstract/Free Full Text]

13.

Attwood,T.K., Bradley,P., Flower,D.R., Gaulton,A.,

Maudling,N., Mitchell,A.L., Moulton,G., Nordle,A., Paine,K., Taylor,P.

et al. (2003) PRINTS and its automatic supplement, preprints. Nucleic 9

2002级生物技术系 王敏 学号021402167

Acids Res., 31, 400–402.[Abstract/Free Full Text]

14.

Servant,F., Bru,C., Carrere,S., Courcelle,E., Couzy,J.,

Peyruc,D.and Kahn,D. (2002) Prodom: Automated clustering of homologous domains. Brief. Bioinform., 3, 246–251.[Medline]

15.

Letunic,I., Goodstadt,L., Dickens,N.J., Doerks,T.,

Schultz,J., Mott,R., Ciccarelli,F., Copley,R.R., Ponting,C.P. and Bork,P. (2002) Recent improvements to the SMART domain-based sequence annotation resource. Nucleic Acids Res., 30, 242–244.[Abstract/Free Full Text]

16.

Wu,C.H., Nikolskaya,A., Huang,H., Yeh,L.-S.,

Natale,D.,Vinayaka,C.R., Hu,Z., Mazumder,R., Kumar,S., Kourtesis,P. et al. (2004) PIRSF: family classification system at the Protein Information Resource. Nucleic Acids Res., 32, D112–D114.[Abstract/Free Full Text]

17.

Gough,J., Karplus,K., Hughey,R. and Chothia,C. (2001)

Assignment of homology to genome sequences using a library of Hidden Markov Models that represent all proteins of known structure. J. Mol. Biol., 313, 903–919.[CrossRef][Medline]

18.

Haft,D.H., Loftus,B.J., Richardson,D.L., Yang,F.,

Eisen,J.A., Paulsen,I.T. and White,O. (2001) TIGRFAMs: a protein family resource for the functional identification of proteins. Nucleic Acids Res., 29, 41–43.[Abstract/Free Full Text]

19.

Fleischmann,W., Moeller,S., Gateau,A. and Apweiler,R. (1999)

A novel method for automatic and reliable functional annotation.

Bioinformatics, 15, 228–233.[Abstract/Free Full Text]

20.

Wu,C.H., Huang,H., Yeh,L.-S. and Barker,W.C. (2003) Protein

family classification and functional annotation. Comput. Biol. Chem., 27, 37–47.[CrossRef][Medline]

10

2002级生物技术系 王敏 学号021402167

21. Gattiker,A., Michoud,K., Rivoire,C., Auchincloss,A.H.,

Coudert,E., Lima,T., Kersey,P., Pagni,M., Sigrist,C.J.A., Lachaize,C.

et al. (2003) Automatic annotation of microbial proteomes in Swiss-Prot. Comput. Biol. Chem., 27, 49–58.[CrossRef][Medline]

22.

Kersey,P., Hermjakob,H. and Apweiler,R. (2000) VARSPLIC:

alternatively-spliced protein sequences derived from Swiss-Prot and TrEMBL. Bioinformatics, 11, 1048–1049.[CrossRef]

23.

Li,W., Jaroszewski,L. and Godzik,A. (2002) Tolerating some

redundancy significantly speeds up clustering of large protein databases. Bioinformatics, 18, 77–82.[Abstract/Free Full Text]

11

百度搜索“77cn”或“免费范文网”即可找到本站免费阅读全部范文。收藏本站方便下次阅读,免费范文网,提供经典小说教育文库UniProt:蛋白质的全信息数据库(2)在线全文阅读。

UniProt:蛋白质的全信息数据库(2).doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印 下载失败或者文档不完整,请联系客服人员解决!
本文链接:https://www.77cn.com.cn/wenku/jiaoyu/959742.html(转载请注明文章来源)
Copyright © 2008-2022 免费范文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ: 邮箱:tiandhx2@hotmail.com
苏ICP备16052595号-18
× 注册会员免费下载(下载后可以自由复制和排版)
注册会员下载
全站内容免费自由复制
注册会员下载
全站内容免费自由复制
注:下载文档有可能“只有目录或者内容不全”等情况,请下载之前注意辨别,如果您已付费且无法下载或内容有问题,请联系我们协助你处理。
微信: QQ: