Bioinformática

Projeto de Banco de Dados Genômicos Ensembl

Pontos principais

  • Lançado em 1999 para automatizar a anotação do genoma humano e de outros vertebrados.
  • Mantido pelo Instituto Europeu de Bioinformática (EMBL-EBI).
  • Utiliza anotação automatizada via pipelines de software para prever a localização de genes.
  • Oferece acesso a mais de 50.000 genomas através do Ensembl e do Ensembl Genomes.
  • Disponibiliza dados sob a licença Creative Commons CC BY 4.0.

O Ensembl é um projeto científico sediado no Instituto Europeu de Bioinformática (EMBL-EBI) que atua como um recurso centralizado para geneticistas, biólogos moleculares e outros pesquisadores. O sistema fornece acesso a informações genômicas de seres humanos, outros vertebrados e diversos organismos modelo, consolidando-se como um dos navegadores de genoma mais utilizados globalmente para a recuperação de dados biológicos.

O projeto opera de forma similar a outros navegadores de genoma proeminentes, como os mantidos pelo National Center for Biotechnology Information (NCBI) e pela Universidade da Califórnia em Santa Cruz (UCSC).

Histórico e Desenvolvimento

O genoma humano é composto por aproximadamente três bilhões de pares de bases, codificando entre 20.000 e 25.000 genes. A identificação da localização e das relações desses genes é fundamental para a utilidade dos dados genômicos. Enquanto a anotação manual, realizada por cientistas com base em dados experimentais, é um processo lento, o Ensembl foi concebido para implementar a anotação automatizada.

Lançado em 1999, coincidindo com a fase final do Projeto Genoma Humano, o Ensembl teve como objetivos iniciais a anotação automática do genoma humano, a integração dessas anotações com dados biológicos existentes e a disponibilização pública de todo esse conhecimento.

O sistema utiliza pipelines de software (originalmente desenvolvidos em Perl) que processam dados de sequenciamento para prever a localização de genes, salvando as informações em um banco de dados MySQL para posterior análise e visualização. Desde a sua criação, o projeto expandiu seu escopo para incluir espécies como camundongos, moscas-das-frutas e peixes-zebra, além de integrar dados sobre variações genéticas e características regulatórias.

Ensembl Genomes

Em abril de 2009, foi criado o projeto irmão Ensembl Genomes. Enquanto o projeto original mantém o foco em vertebrados, o Ensembl Genomes expandiu a cobertura para metazoários invertebrados, plantas, fungos, bactérias e protistas, fornecendo um contexto taxonômico e evolutivo essencial para o estudo de genes.

Até 2020, o ecossistema Ensembl suportava mais de 50.000 genomas. Recentemente, foram introduzidas funcionalidades como o Rapid Release, para acelerar a disponibilização de anotações, e um portal específico para o genoma de referência do SARS-CoV-2 (COVID-19).

Visualização de Dados Genômicos

A principal característica do Ensembl é a capacidade de gerar visualizações gráficas automáticas do alinhamento de genes e outros dados genômicos contra um genoma de referência. Essas informações são apresentadas em trilhas de dados (data tracks), que podem ser ativadas ou desativadas pelo usuário para personalizar a visualização de acordo com a necessidade da pesquisa.

Captura de tela da interface do Ensembl mostrando trilhas de dados genômicos
Interface do Ensembl exibindo a organização de genes e anotações genômicas.

A interface permite níveis variados de resolução, desde a visualização de cariótipos completos até representações textuais de sequências de DNA e aminoácidos. O sistema também gera árvores de genes homólogos entre diferentes espécies. Os dados podem ser exportados em formatos padrão, como o FASTA, e pesquisadores podem fazer o upload de seus próprios dados nos formatos BAM, BED ou PSL para integração à visualização.

Métodos de Acesso e Ferramentas

Além da interface web, o Ensembl oferece diversas formas de interação com seus dados:

  • APIs: Disponibiliza APIs em REST e Perl, que modelam objetos biológicos (genes, proteínas), facilitando a criação de scripts para recuperação de dados. A API é dividida em módulos: core (núcleo), compara (genômica comparativa), variation (SNPs, SNVs, CNVs) e functional genomics (dados regulatórios).
  • BioMart: Uma ferramenta de mineração de dados com interface web que permite a exportação de conjuntos de dados complexos através de consultas personalizadas.
  • Acesso Direto e FTP: É possível realizar consultas SQL diretas ao banco de dados MySQL ou baixar bases de dados completas e conjuntos de dados selecionados via servidor FTP.

Acesso Aberto e Licenciamento

Todos os dados do projeto Ensembl são de acesso aberto e o software é de código aberto, distribuído sob a licença CC BY 4.0. Para otimizar a performance e a disponibilidade global, o banco de dados é espelhado em três localizações diferentes ao redor do mundo.

Perguntas frequentes

O que é o projeto Ensembl?

É um projeto de bioinformática do Instituto Europeu de Bioinformática que fornece anotações automatizadas de genomas de vertebrados e outros organismos modelo, permitindo que pesquisadores acessem a localização e a função de genes.

Qual a diferença entre o Ensembl e o Ensembl Genomes?

O Ensembl original foca primariamente em vertebrados, enquanto o Ensembl Genomes expandia o escopo para incluir plantas, fungos, bactérias, protistas e metazoários invertebrados.

Como os pesquisadores podem extrair dados do Ensembl?

Os dados podem ser acessados via interface web, através de APIs (REST e Perl), por meio da ferramenta de mineração de dados BioMart ou via download direto por FTP.

O Ensembl é gratuito?

Sim, todos os dados e softwares do projeto são de acesso aberto e distribuídos sob a licença CC BY 4.0.