Skip to Main Content (Press Enter)

Logo UNITO
  • ×
  • Home
  • Pubblicazioni
  • Progetti
  • Persone
  • Competenze
  • Settori
  • Strutture
  • Terza Missione

UNI-FIND
Logo UNITO

|

UNI-FIND

unito.it
  • ×
  • Home
  • Pubblicazioni
  • Progetti
  • Persone
  • Competenze
  • Settori
  • Strutture
  • Terza Missione
  1. Pubblicazioni

Biologically meaningful genome interpretation models to address data underdetermination for the leaf and seed ionome prediction in Arabidopsis thaliana

Articolo
Data di Pubblicazione:
2024
Abstract:
Genome interpretation (GI) encompasses the computational attempts to model the relationship between genotype and phenotype with the goal of understanding how the first leads to the second. While traditional approaches have focused on sub-problems such as predicting the effect of single nucleotide variants or finding genetic associations, recent advances in neural networks (NNs) have made it possible to develop end-to-end GI models that take genomic data as input and predict phenotypes as output. However, technical and modeling issues still need to be fixed for these models to be effective, including the widespread underdetermination of genomic datasets, making them unsuitable for training large, overfitting-prone, NNs. Here we propose novel GI models to address this issue, exploring the use of two types of transfer learning approaches and proposing a novel Biologically Meaningful Sparse NN layer specifically designed for end-to-end GI. Our models predict the leaf and seed ionome in A.thaliana, obtaining comparable results to our previous over-parameterized model while reducing the number of parameters by 8.8 folds. We also investigate how the effect of population stratification influences the evaluation of the performances, highlighting how it leads to (1) an instance of the Simpson's Paradox, and (2) model generalization limitations.
Tipologia CRIS:
03A-Articolo su Rivista
Keywords:
Arabidopsis thaliana; Deep learning; Ionome prediction; Genomic prediction; Genome interpretation
Elenco autori:
Raimondi, Daniele; Passemiers, Antoine; Verplaetse, Nora; Corso, Massimiliano; Ferrero-Serrano, Ángel; Nazzicari, Nelson; Biscarini, Filippo; Fariselli, Piero; Moreau, Yves
Autori di Ateneo:
FARISELLI Piero
Link alla scheda completa:
https://iris.unito.it/handle/2318/2028718
Link al Full Text:
https://iris.unito.it/retrieve/handle/2318/2028718/1406618/Raimondi_SciRep_2024_s41598-024-63855-6.pdf
Pubblicato in:
SCIENTIFIC REPORTS
Journal
  • Aree Di Ricerca

Aree Di Ricerca

Settori (17)


LS2_11 - Bioinformatics and computational biology - (2024)

PE3_16 - Physics of biological systems - (2024)

PE6_13 - Bioinformatics, bio-inspired computing, and natural computing - (2024)

CIBO, AGRICOLTURA e ALLEVAMENTI - Agricoltura e Produzioni Vegetali

CIBO, AGRICOLTURA e ALLEVAMENTI - Allevamento e Produzioni Animali

CIBO, AGRICOLTURA e ALLEVAMENTI - Farmacologia Veterinaria

CIBO, AGRICOLTURA e ALLEVAMENTI - Miglioramento e difesa delle colture

CIBO, AGRICOLTURA e ALLEVAMENTI - Patologia e malattie degli animali

CIBO, AGRICOLTURA e ALLEVAMENTI - Scienze cliniche veterinarie

CIBO, AGRICOLTURA e ALLEVAMENTI - Tecnologie alimentari e microbiologia degli alimenti

INFORMATICA, AUTOMAZIONE e INTELLIGENZA ARTIFICIALE - Genetica, Omica e Bioinformatica

INFORMATICA, AUTOMAZIONE e INTELLIGENZA ARTIFICIALE - Salute e Informatica

MEDICINA, SALUTE e BENESSERE - Epidemiologia

MEDICINA, SALUTE e BENESSERE - Malattie neurologiche e neurodegenerative

MEDICINA, SALUTE e BENESSERE - Oncologia e Tumori

MEDICINA, SALUTE e BENESSERE - Ricerca Traslazionale e Clinica

SCIENZE DELLA VITA e FARMACOLOGIA - Interazioni tra molecole, cellule, organismi e ambiente
  • Utilizzo dei cookie

Realizzato con VIVO | Designed by Cineca | 25.6.1.0