Seleção de características e predição intrinsecamente multivariada em identificação de redes de regulação gênica

Seleção de características é um tópico muito importante em aplicações de reconhecimento de padrões, especialmente em bioinformática, cujos problemas são geralmente tratados sobre um conjunto de dados envolvendo muitas variáveis e poucas observações. Este trabalho analisa aspectos de seleção de carac...

Full description

Bibliographic Details
Main Author: Martins Junior, David Corrêa
Other Authors: Barrera, Junior
Format: Others
Language:pt
Published: Biblioteca Digitais de Teses e Dissertações da USP 2008
Subjects:
Online Access:http://www.teses.usp.br/teses/disponiveis/45/45134/tde-04012010-175308/
id ndltd-usp.br-oai-teses.usp.br-tde-04012010-175308
record_format oai_dc
collection NDLTD
language pt
format Others
sources NDLTD
topic coefficient of determination
coeficiente de determinação
entropia condicional média
feature selection
gene regulatory networks
intrinsically multivariate prediction
malaria
malária
mean conditional entropy
melanoma
melanoma
microarray
microarray
predição intrinsecamente multivariada
redes de regulação gênica
seleção de características
spellingShingle coefficient of determination
coeficiente de determinação
entropia condicional média
feature selection
gene regulatory networks
intrinsically multivariate prediction
malaria
malária
mean conditional entropy
melanoma
melanoma
microarray
microarray
predição intrinsecamente multivariada
redes de regulação gênica
seleção de características
Martins Junior, David Corrêa
Seleção de características e predição intrinsecamente multivariada em identificação de redes de regulação gênica
description Seleção de características é um tópico muito importante em aplicações de reconhecimento de padrões, especialmente em bioinformática, cujos problemas são geralmente tratados sobre um conjunto de dados envolvendo muitas variáveis e poucas observações. Este trabalho analisa aspectos de seleção de características no problema de identificação de redes de regulação gênica a partir de sinais de expressão gênica. Particularmente, propusemos um modelo de redes gênicas probabilísticas (PGN) que devolve uma rede construída a partir da aplicação recorrente de algoritmos de seleção de características orientados por uma função critério baseada em entropia condicional. Tal critério embute a estimação do erro por penalização de amostras raramente observadas. Resultados desse modelo aplicado a dados sintéticos e a conjuntos de dados de microarray de Plasmodium falciparum, um agente causador da malária, demonstram a validade dessa técnica, tendo sido capaz não apenas de reproduzir conhecimentos já produzidos anteriormente, como também de produzir novos resultados. Outro aspecto investigado nesta tese é o fenômeno da predição intrinsecamente multivariada (IMP), ou seja, o fato de um conjunto de características ser um ótimo caracterizador dos objetos em questão, mas qualquer de seus subconjuntos propriamente contidos não conseguirem representá-los de forma satisfatória. Neste trabalho, as condições para o surgimento desse fenômeno foram obtidas de forma analítica para conjuntos de 2 e 3 características em relação a uma variável alvo. No contexto de redes de regulação gênica, foram obtidas evidências de que genes alvo de conjuntos IMP possuem um enorme potencial para exercerem funções vitais em sistemas biológicos. O fenômeno conhecido como canalização é particularmente importante nesse contexto. Em dados de microarray de melanoma, constatamos que o gene DUSP1, conhecido por exercer função canalizadora, foi aquele que obteve o maior número de conjuntos de genes IMP, sendo que todos eles possuem lógicas de predição canalizadoras. Além disso, simulações computacionais para construção de redes com 3 ou mais genes mostram que o tamanho do território de um gene alvo pode ter um impacto positivo em seu teor de IMP com relação a seus preditores. Esta pode ser uma evidência que confirma a hipótese de que genes alvo de conjuntos IMP possuem a tendência de controlar diversas vias metabólicas cruciais para a manutenção das funções vitais de um organismo. === Feature selection is a crucial topic in pattern recognition applications, especially in bioinformatics, where problems usually involve data with a large number of variables and small number of observations. The present work addresses feature selection aspects in the problem of gene regulatory network identification from expression profiles. Particularly, we proposed a probabilistic genetic network model (PGN) that recovers a network constructed from the recurrent application of feature selection algorithms guided by a conditional entropy based criterion function. Such criterion embeds error estimation by penalization of rarely observed patterns. Results from this model applied to synthetic and real data sets obtained from Plasmodium falciparum microarrays, a malaria agent, demonstrate the validity of this technique. This method was able to not only reproduce previously produced knowledge, but also to produce other potentially relevant results. The intrinsically multivariate prediction (IMP) phenomenon has been also investigated. This phenomenon is related to the fact of a feature set being a nice predictor of the objects in study, but all of its properly contained subsets cannot predict such objects satisfactorily. In this work, the conditions for the rising of this phenomenon were analitically obtained for sets of 2 and 3 features regarding a target variable. In the gene regulatory networks context, evidences have been achieved in which target genes of IMP sets possess a great potential to execute vital functions in biological systems. The phenomenon known as canalization is particularly important in this context. In melanoma microarray data, we verified that DUSP1 gene, known by having canalization function, was the one which composed the largest number of IMP gene sets. It was also verified that all these sets have canalizing predictive logics. Moreover, computational simulations for generation of networks with 3 or more genes show that the territory size of a target gene can contribute positively to its IMP score with regard to its predictors. This could be an evidence that confirms the hypothesis stating that target genes of IMP sets are inclined to control several metabolic pathways essential to the maintenance of the vital functions of an organism.
author2 Barrera, Junior
author_facet Barrera, Junior
Martins Junior, David Corrêa
author Martins Junior, David Corrêa
author_sort Martins Junior, David Corrêa
title Seleção de características e predição intrinsecamente multivariada em identificação de redes de regulação gênica
title_short Seleção de características e predição intrinsecamente multivariada em identificação de redes de regulação gênica
title_full Seleção de características e predição intrinsecamente multivariada em identificação de redes de regulação gênica
title_fullStr Seleção de características e predição intrinsecamente multivariada em identificação de redes de regulação gênica
title_full_unstemmed Seleção de características e predição intrinsecamente multivariada em identificação de redes de regulação gênica
title_sort seleção de características e predição intrinsecamente multivariada em identificação de redes de regulação gênica
publisher Biblioteca Digitais de Teses e Dissertações da USP
publishDate 2008
url http://www.teses.usp.br/teses/disponiveis/45/45134/tde-04012010-175308/
work_keys_str_mv AT martinsjuniordavidcorrea selecaodecaracteristicasepredicaointrinsecamentemultivariadaemidentificacaoderedesderegulacaogenica
AT martinsjuniordavidcorrea featureselectionandintrinsicallymultivariatepredictioningeneregulatorynetworksidentification
_version_ 1719051072655327232
spelling ndltd-usp.br-oai-teses.usp.br-tde-04012010-1753082019-05-09T17:51:12Z Seleção de características e predição intrinsecamente multivariada em identificação de redes de regulação gênica Feature selection and intrinsically multivariate prediction in gene regulatory networks identification Martins Junior, David Corrêa coefficient of determination coeficiente de determinação entropia condicional média feature selection gene regulatory networks intrinsically multivariate prediction malaria malária mean conditional entropy melanoma melanoma microarray microarray predição intrinsecamente multivariada redes de regulação gênica seleção de características Seleção de características é um tópico muito importante em aplicações de reconhecimento de padrões, especialmente em bioinformática, cujos problemas são geralmente tratados sobre um conjunto de dados envolvendo muitas variáveis e poucas observações. Este trabalho analisa aspectos de seleção de características no problema de identificação de redes de regulação gênica a partir de sinais de expressão gênica. Particularmente, propusemos um modelo de redes gênicas probabilísticas (PGN) que devolve uma rede construída a partir da aplicação recorrente de algoritmos de seleção de características orientados por uma função critério baseada em entropia condicional. Tal critério embute a estimação do erro por penalização de amostras raramente observadas. Resultados desse modelo aplicado a dados sintéticos e a conjuntos de dados de microarray de Plasmodium falciparum, um agente causador da malária, demonstram a validade dessa técnica, tendo sido capaz não apenas de reproduzir conhecimentos já produzidos anteriormente, como também de produzir novos resultados. Outro aspecto investigado nesta tese é o fenômeno da predição intrinsecamente multivariada (IMP), ou seja, o fato de um conjunto de características ser um ótimo caracterizador dos objetos em questão, mas qualquer de seus subconjuntos propriamente contidos não conseguirem representá-los de forma satisfatória. Neste trabalho, as condições para o surgimento desse fenômeno foram obtidas de forma analítica para conjuntos de 2 e 3 características em relação a uma variável alvo. No contexto de redes de regulação gênica, foram obtidas evidências de que genes alvo de conjuntos IMP possuem um enorme potencial para exercerem funções vitais em sistemas biológicos. O fenômeno conhecido como canalização é particularmente importante nesse contexto. Em dados de microarray de melanoma, constatamos que o gene DUSP1, conhecido por exercer função canalizadora, foi aquele que obteve o maior número de conjuntos de genes IMP, sendo que todos eles possuem lógicas de predição canalizadoras. Além disso, simulações computacionais para construção de redes com 3 ou mais genes mostram que o tamanho do território de um gene alvo pode ter um impacto positivo em seu teor de IMP com relação a seus preditores. Esta pode ser uma evidência que confirma a hipótese de que genes alvo de conjuntos IMP possuem a tendência de controlar diversas vias metabólicas cruciais para a manutenção das funções vitais de um organismo. Feature selection is a crucial topic in pattern recognition applications, especially in bioinformatics, where problems usually involve data with a large number of variables and small number of observations. The present work addresses feature selection aspects in the problem of gene regulatory network identification from expression profiles. Particularly, we proposed a probabilistic genetic network model (PGN) that recovers a network constructed from the recurrent application of feature selection algorithms guided by a conditional entropy based criterion function. Such criterion embeds error estimation by penalization of rarely observed patterns. Results from this model applied to synthetic and real data sets obtained from Plasmodium falciparum microarrays, a malaria agent, demonstrate the validity of this technique. This method was able to not only reproduce previously produced knowledge, but also to produce other potentially relevant results. The intrinsically multivariate prediction (IMP) phenomenon has been also investigated. This phenomenon is related to the fact of a feature set being a nice predictor of the objects in study, but all of its properly contained subsets cannot predict such objects satisfactorily. In this work, the conditions for the rising of this phenomenon were analitically obtained for sets of 2 and 3 features regarding a target variable. In the gene regulatory networks context, evidences have been achieved in which target genes of IMP sets possess a great potential to execute vital functions in biological systems. The phenomenon known as canalization is particularly important in this context. In melanoma microarray data, we verified that DUSP1 gene, known by having canalization function, was the one which composed the largest number of IMP gene sets. It was also verified that all these sets have canalizing predictive logics. Moreover, computational simulations for generation of networks with 3 or more genes show that the territory size of a target gene can contribute positively to its IMP score with regard to its predictors. This could be an evidence that confirms the hypothesis stating that target genes of IMP sets are inclined to control several metabolic pathways essential to the maintenance of the vital functions of an organism. Biblioteca Digitais de Teses e Dissertações da USP Barrera, Junior Cesar Junior, Roberto Marcondes 2008-12-01 Tese de Doutorado application/pdf http://www.teses.usp.br/teses/disponiveis/45/45134/tde-04012010-175308/ pt Liberar o conteúdo para acesso público.