Concordancia entre métodos de imputación de genotipos

Autores
Raschia, Maria Agustina; Ríos, Pablo Javier; Cordoba, Marcela Elisabet; Caffaro, María Eugenia; Maizon, Daniel Omar; Demitrio, Daniel Arturo; Poli, Mario Andres
Año de publicación
2026
Idioma
español castellano
Tipo de recurso
documento de conferencia
Estado
versión publicada
Descripción
Genotype imputation improves genomic coverage by combining data obtained from microarrays of different densities or platforms and inferring unassigned genotypes. This study compared three imputation strategies using a dataset of 1,153 Corriedale sheep genotyped for 54,718 SNPs, with 28.21% missing data: Random Forest (RF), Sparse Convolutional Denoising Autoencoders (SCDA), and FImpute. Random Forest was implemented using the impute() method, in 28 blocks corresponding to markers with undefined genomic positions, autosomes, and the X chromosome. The SCDA model was trained using a training (80% of the population) and a validation (20% of the population) partitions over 40 epochs, selecting the model with the lowest loss and reasonable accuracy in the validation partition. FImpute was run on all markers with defined positions, incorporating pedigree information. All three strategies achieved complete imputation of missing genotypes; FImpute additionally corrected 0.13% of assigned genotypes by detecting Mendelian errors. Comparison of the imputed genotypes showed higher concordance between RF and FImpute (63.54%) than between SCDA and FImpute (52.02%), with uniform values across autosomes and slightly higher concordance on the X chromosome. Assuming greater accuracy for FImpute, RF outperformed SCDA in this dataset. These results support further exploration of these strategies using datasets with varying proportions of missing data and masking some assigned genotypes to evaluate imputation accuracy.
La imputación de genotipos permite mejorar la cobertura genómica al combinar datos obtenidos con microarreglos de distinta densidad o plataforma e inferir genotipos no asignados. Este estudio comparó tres estrategias de imputación utilizando un dataset compuesto por genotipos de 1.153 ovinos Corriedale en 54.718 SNPs, con un 28,21% de datos faltantes: Random Forest (RF), autoencoders convolucionales dispersos para la eliminación de ruido (SCDA) y FImpute. Random forest se implementó a través del método impute(), ejecutándolo en 28 bloques correspondientes a marcadores con posición indefinida en el genoma, autosomas y cromosoma X. El modelo SCDA se entrenó usando una partición de training (80% de la población) y otra de validación (20% de la población) durante 40 epochs, seleccionándose el modelo que presentó la menor pérdida y una precisión razonable en la partición de validación. FImpute se ejecutó sobre todos los marcadores con posición definida, considerando la información de pedigree. Las tres estrategias condujeron a una imputación completa de los genotipos faltantes; FImpute, además, corrigió un 0,13% de genotipos asignados por hallar errores mendelianos. La comparación de los genotipos imputados mostró mayor concordancia entre RF y FImpute (63,54%) que entre SCDA y FImpute (52,02%), con valores uniformes en los autosomas y ligeramente superiores en el cromosoma X. Asumiendo una mayor precisión para FImpute, RF mostró mejor desempeño que SCDA en el dataset empleado. Estos resultados motivan continuar explorando estas estrategias, utilizando datasets con distintos porcentajes de datos faltantes y enmascarando algunos genotipos para evaluar la precisión en las imputaciones logradas.
Instituto de Genética
Fil: Raschia, María Agustina. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; Argentina
Fil: Raschia, María Agustina. Universidad Nacional de La Plata. Facultad de Ciencias Médicas; Argentina
Fil: Ríos, Pablo Javier. Universidad de Buenos Aires; Argentina
Fil: Ríos, Pablo Javier. Universidad Nacional de La Plata. Facultad de Ciencias Exactas; Argentina
Fil: Cordoba, Marcela Elizabet. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; Argentina
Fil: Caffaro, María Eugenia. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; Argentina
Fil: Maizon, Daniel Omar. Instituto de Tecnología Agropecuaria (INTA). Estación Experimental Agropecuaria Anguil; Argentina
Fil: Maizon, Daniel Omar. Universidad Nacional de La Pampa. Facultad de Agronomía; Argentina
Fil: Demitrio, Daniel Arturo. Instituto Nacional de Tecnología Agropecuaria (INTA). Coordinación Nacional de Relaciones Institucionales y Vinculación Tecnológica; Argentina
Fil: Demitrio, Daniel Arturo. Universidad Nacional de La Plata. Facultad de Ciencias Exactas; Argentina
Fil: Poli, Mario Andrés. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; Argentina
Fil: Poli, Mario Andrés. Universidad del Salvador. Facultad de Ciencias Agrarias y Veterinaria; Argentina
Fuente
55as Jornadas Argentinas de Informática e Investigación Operativa (55 JAIIO) , 18o Congreso Argentino de AgroInformática. 10 al 13 de agosto de 2026, La Plata, Argentina
Materia
Genotypes
Gene Pools
Reserva Genética
Single Nucleotide Polymorphisms
Genotipos
Polimorfismo de Nucleótido Unico
Autoencoders
Nivel de accesibilidad
acceso abierto
Condiciones de uso
http://creativecommons.org/licenses/by-nc-sa/4.0/
Repositorio
INTA Digital (INTA)
Institución
Instituto Nacional de Tecnología Agropecuaria
OAI Identificador
oai:localhost:20.500.12123/27912

id INTADig_244b7074fd636b148090f93412befde5
oai_identifier_str oai:localhost:20.500.12123/27912
network_acronym_str INTADig
repository_id_str l
network_name_str INTA Digital (INTA)
spelling Concordancia entre métodos de imputación de genotiposConcordance between genotype imputation methodsRaschia, Maria AgustinaRíos, Pablo JavierCordoba, Marcela ElisabetCaffaro, María EugeniaMaizon, Daniel OmarDemitrio, Daniel ArturoPoli, Mario AndresGenotypesGene PoolsReserva GenéticaSingle Nucleotide PolymorphismsGenotiposPolimorfismo de Nucleótido UnicoAutoencodersGenotype imputation improves genomic coverage by combining data obtained from microarrays of different densities or platforms and inferring unassigned genotypes. This study compared three imputation strategies using a dataset of 1,153 Corriedale sheep genotyped for 54,718 SNPs, with 28.21% missing data: Random Forest (RF), Sparse Convolutional Denoising Autoencoders (SCDA), and FImpute. Random Forest was implemented using the impute() method, in 28 blocks corresponding to markers with undefined genomic positions, autosomes, and the X chromosome. The SCDA model was trained using a training (80% of the population) and a validation (20% of the population) partitions over 40 epochs, selecting the model with the lowest loss and reasonable accuracy in the validation partition. FImpute was run on all markers with defined positions, incorporating pedigree information. All three strategies achieved complete imputation of missing genotypes; FImpute additionally corrected 0.13% of assigned genotypes by detecting Mendelian errors. Comparison of the imputed genotypes showed higher concordance between RF and FImpute (63.54%) than between SCDA and FImpute (52.02%), with uniform values across autosomes and slightly higher concordance on the X chromosome. Assuming greater accuracy for FImpute, RF outperformed SCDA in this dataset. These results support further exploration of these strategies using datasets with varying proportions of missing data and masking some assigned genotypes to evaluate imputation accuracy.La imputación de genotipos permite mejorar la cobertura genómica al combinar datos obtenidos con microarreglos de distinta densidad o plataforma e inferir genotipos no asignados. Este estudio comparó tres estrategias de imputación utilizando un dataset compuesto por genotipos de 1.153 ovinos Corriedale en 54.718 SNPs, con un 28,21% de datos faltantes: Random Forest (RF), autoencoders convolucionales dispersos para la eliminación de ruido (SCDA) y FImpute. Random forest se implementó a través del método impute(), ejecutándolo en 28 bloques correspondientes a marcadores con posición indefinida en el genoma, autosomas y cromosoma X. El modelo SCDA se entrenó usando una partición de training (80% de la población) y otra de validación (20% de la población) durante 40 epochs, seleccionándose el modelo que presentó la menor pérdida y una precisión razonable en la partición de validación. FImpute se ejecutó sobre todos los marcadores con posición definida, considerando la información de pedigree. Las tres estrategias condujeron a una imputación completa de los genotipos faltantes; FImpute, además, corrigió un 0,13% de genotipos asignados por hallar errores mendelianos. La comparación de los genotipos imputados mostró mayor concordancia entre RF y FImpute (63,54%) que entre SCDA y FImpute (52,02%), con valores uniformes en los autosomas y ligeramente superiores en el cromosoma X. Asumiendo una mayor precisión para FImpute, RF mostró mejor desempeño que SCDA en el dataset empleado. Estos resultados motivan continuar explorando estas estrategias, utilizando datasets con distintos porcentajes de datos faltantes y enmascarando algunos genotipos para evaluar la precisión en las imputaciones logradas.Instituto de GenéticaFil: Raschia, María Agustina. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; ArgentinaFil: Raschia, María Agustina. Universidad Nacional de La Plata. Facultad de Ciencias Médicas; ArgentinaFil: Ríos, Pablo Javier. Universidad de Buenos Aires; ArgentinaFil: Ríos, Pablo Javier. Universidad Nacional de La Plata. Facultad de Ciencias Exactas; ArgentinaFil: Cordoba, Marcela Elizabet. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; ArgentinaFil: Caffaro, María Eugenia. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; ArgentinaFil: Maizon, Daniel Omar. Instituto de Tecnología Agropecuaria (INTA). Estación Experimental Agropecuaria Anguil; ArgentinaFil: Maizon, Daniel Omar. Universidad Nacional de La Pampa. Facultad de Agronomía; ArgentinaFil: Demitrio, Daniel Arturo. Instituto Nacional de Tecnología Agropecuaria (INTA). Coordinación Nacional de Relaciones Institucionales y Vinculación Tecnológica; ArgentinaFil: Demitrio, Daniel Arturo. Universidad Nacional de La Plata. Facultad de Ciencias Exactas; ArgentinaFil: Poli, Mario Andrés. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; ArgentinaFil: Poli, Mario Andrés. Universidad del Salvador. Facultad de Ciencias Agrarias y Veterinaria; ArgentinaSociedad Argentina de Informática e Investigación Operativa (SADIO)2026-09-23T14:47:56Z2026-09-23T14:47:56Z2026-08info:eu-repo/semantics/conferenceObjectinfo:eu-repo/semantics/publishedVersionhttp://purl.org/coar/resource_type/c_5794info:ar-repo/semantics/documentoDeConferenciaapplication/pdfhttp://hdl.handle.net/20.500.12123/2791255as Jornadas Argentinas de Informática e Investigación Operativa (55 JAIIO) , 18o Congreso Argentino de AgroInformática. 10 al 13 de agosto de 2026, La Plata, Argentinareponame:INTA Digital (INTA)instname:Instituto Nacional de Tecnología Agropecuariaspainfo:eu-repo/semantics/openAccesshttp://creativecommons.org/licenses/by-nc-sa/4.0/Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0)2026-09-24T11:43:52Zoai:localhost:20.500.12123/27912instacron:INTAInstitucionalhttp://repositorio.inta.gob.ar/Organismo científico-tecnológicoNo correspondehttp://repositorio.inta.gob.ar/oai/requesttripaldi.nicolas@inta.gob.arArgentinaNo correspondeNo correspondeNo correspondeopendoar:l2026-09-24 11:43:53.022INTA Digital (INTA) - Instituto Nacional de Tecnología Agropecuariafalse
dc.title.none.fl_str_mv Concordancia entre métodos de imputación de genotipos
Concordance between genotype imputation methods
title Concordancia entre métodos de imputación de genotipos
spellingShingle Concordancia entre métodos de imputación de genotipos
Raschia, Maria Agustina
Genotypes
Gene Pools
Reserva Genética
Single Nucleotide Polymorphisms
Genotipos
Polimorfismo de Nucleótido Unico
Autoencoders
title_short Concordancia entre métodos de imputación de genotipos
title_full Concordancia entre métodos de imputación de genotipos
title_fullStr Concordancia entre métodos de imputación de genotipos
title_full_unstemmed Concordancia entre métodos de imputación de genotipos
title_sort Concordancia entre métodos de imputación de genotipos
dc.creator.none.fl_str_mv Raschia, Maria Agustina
Ríos, Pablo Javier
Cordoba, Marcela Elisabet
Caffaro, María Eugenia
Maizon, Daniel Omar
Demitrio, Daniel Arturo
Poli, Mario Andres
author Raschia, Maria Agustina
author_facet Raschia, Maria Agustina
Ríos, Pablo Javier
Cordoba, Marcela Elisabet
Caffaro, María Eugenia
Maizon, Daniel Omar
Demitrio, Daniel Arturo
Poli, Mario Andres
author_role author
author2 Ríos, Pablo Javier
Cordoba, Marcela Elisabet
Caffaro, María Eugenia
Maizon, Daniel Omar
Demitrio, Daniel Arturo
Poli, Mario Andres
author2_role author
author
author
author
author
author
dc.subject.none.fl_str_mv Genotypes
Gene Pools
Reserva Genética
Single Nucleotide Polymorphisms
Genotipos
Polimorfismo de Nucleótido Unico
Autoencoders
topic Genotypes
Gene Pools
Reserva Genética
Single Nucleotide Polymorphisms
Genotipos
Polimorfismo de Nucleótido Unico
Autoencoders
dc.description.none.fl_txt_mv Genotype imputation improves genomic coverage by combining data obtained from microarrays of different densities or platforms and inferring unassigned genotypes. This study compared three imputation strategies using a dataset of 1,153 Corriedale sheep genotyped for 54,718 SNPs, with 28.21% missing data: Random Forest (RF), Sparse Convolutional Denoising Autoencoders (SCDA), and FImpute. Random Forest was implemented using the impute() method, in 28 blocks corresponding to markers with undefined genomic positions, autosomes, and the X chromosome. The SCDA model was trained using a training (80% of the population) and a validation (20% of the population) partitions over 40 epochs, selecting the model with the lowest loss and reasonable accuracy in the validation partition. FImpute was run on all markers with defined positions, incorporating pedigree information. All three strategies achieved complete imputation of missing genotypes; FImpute additionally corrected 0.13% of assigned genotypes by detecting Mendelian errors. Comparison of the imputed genotypes showed higher concordance between RF and FImpute (63.54%) than between SCDA and FImpute (52.02%), with uniform values across autosomes and slightly higher concordance on the X chromosome. Assuming greater accuracy for FImpute, RF outperformed SCDA in this dataset. These results support further exploration of these strategies using datasets with varying proportions of missing data and masking some assigned genotypes to evaluate imputation accuracy.
La imputación de genotipos permite mejorar la cobertura genómica al combinar datos obtenidos con microarreglos de distinta densidad o plataforma e inferir genotipos no asignados. Este estudio comparó tres estrategias de imputación utilizando un dataset compuesto por genotipos de 1.153 ovinos Corriedale en 54.718 SNPs, con un 28,21% de datos faltantes: Random Forest (RF), autoencoders convolucionales dispersos para la eliminación de ruido (SCDA) y FImpute. Random forest se implementó a través del método impute(), ejecutándolo en 28 bloques correspondientes a marcadores con posición indefinida en el genoma, autosomas y cromosoma X. El modelo SCDA se entrenó usando una partición de training (80% de la población) y otra de validación (20% de la población) durante 40 epochs, seleccionándose el modelo que presentó la menor pérdida y una precisión razonable en la partición de validación. FImpute se ejecutó sobre todos los marcadores con posición definida, considerando la información de pedigree. Las tres estrategias condujeron a una imputación completa de los genotipos faltantes; FImpute, además, corrigió un 0,13% de genotipos asignados por hallar errores mendelianos. La comparación de los genotipos imputados mostró mayor concordancia entre RF y FImpute (63,54%) que entre SCDA y FImpute (52,02%), con valores uniformes en los autosomas y ligeramente superiores en el cromosoma X. Asumiendo una mayor precisión para FImpute, RF mostró mejor desempeño que SCDA en el dataset empleado. Estos resultados motivan continuar explorando estas estrategias, utilizando datasets con distintos porcentajes de datos faltantes y enmascarando algunos genotipos para evaluar la precisión en las imputaciones logradas.
Instituto de Genética
Fil: Raschia, María Agustina. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; Argentina
Fil: Raschia, María Agustina. Universidad Nacional de La Plata. Facultad de Ciencias Médicas; Argentina
Fil: Ríos, Pablo Javier. Universidad de Buenos Aires; Argentina
Fil: Ríos, Pablo Javier. Universidad Nacional de La Plata. Facultad de Ciencias Exactas; Argentina
Fil: Cordoba, Marcela Elizabet. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; Argentina
Fil: Caffaro, María Eugenia. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; Argentina
Fil: Maizon, Daniel Omar. Instituto de Tecnología Agropecuaria (INTA). Estación Experimental Agropecuaria Anguil; Argentina
Fil: Maizon, Daniel Omar. Universidad Nacional de La Pampa. Facultad de Agronomía; Argentina
Fil: Demitrio, Daniel Arturo. Instituto Nacional de Tecnología Agropecuaria (INTA). Coordinación Nacional de Relaciones Institucionales y Vinculación Tecnológica; Argentina
Fil: Demitrio, Daniel Arturo. Universidad Nacional de La Plata. Facultad de Ciencias Exactas; Argentina
Fil: Poli, Mario Andrés. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; Argentina
Fil: Poli, Mario Andrés. Universidad del Salvador. Facultad de Ciencias Agrarias y Veterinaria; Argentina
description Genotype imputation improves genomic coverage by combining data obtained from microarrays of different densities or platforms and inferring unassigned genotypes. This study compared three imputation strategies using a dataset of 1,153 Corriedale sheep genotyped for 54,718 SNPs, with 28.21% missing data: Random Forest (RF), Sparse Convolutional Denoising Autoencoders (SCDA), and FImpute. Random Forest was implemented using the impute() method, in 28 blocks corresponding to markers with undefined genomic positions, autosomes, and the X chromosome. The SCDA model was trained using a training (80% of the population) and a validation (20% of the population) partitions over 40 epochs, selecting the model with the lowest loss and reasonable accuracy in the validation partition. FImpute was run on all markers with defined positions, incorporating pedigree information. All three strategies achieved complete imputation of missing genotypes; FImpute additionally corrected 0.13% of assigned genotypes by detecting Mendelian errors. Comparison of the imputed genotypes showed higher concordance between RF and FImpute (63.54%) than between SCDA and FImpute (52.02%), with uniform values across autosomes and slightly higher concordance on the X chromosome. Assuming greater accuracy for FImpute, RF outperformed SCDA in this dataset. These results support further exploration of these strategies using datasets with varying proportions of missing data and masking some assigned genotypes to evaluate imputation accuracy.
publishDate 2026
dc.date.none.fl_str_mv 2026-09-23T14:47:56Z
2026-09-23T14:47:56Z
2026-08
dc.type.none.fl_str_mv info:eu-repo/semantics/conferenceObject
info:eu-repo/semantics/publishedVersion
http://purl.org/coar/resource_type/c_5794
info:ar-repo/semantics/documentoDeConferencia
format conferenceObject
status_str publishedVersion
dc.identifier.none.fl_str_mv http://hdl.handle.net/20.500.12123/27912
url http://hdl.handle.net/20.500.12123/27912
dc.language.none.fl_str_mv spa
language spa
dc.rights.none.fl_str_mv info:eu-repo/semantics/openAccess
http://creativecommons.org/licenses/by-nc-sa/4.0/
Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0)
eu_rights_str_mv openAccess
rights_invalid_str_mv http://creativecommons.org/licenses/by-nc-sa/4.0/
Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0)
dc.format.none.fl_str_mv application/pdf
dc.publisher.none.fl_str_mv Sociedad Argentina de Informática e Investigación Operativa (SADIO)
publisher.none.fl_str_mv Sociedad Argentina de Informática e Investigación Operativa (SADIO)
dc.source.none.fl_str_mv 55as Jornadas Argentinas de Informática e Investigación Operativa (55 JAIIO) , 18o Congreso Argentino de AgroInformática. 10 al 13 de agosto de 2026, La Plata, Argentina
reponame:INTA Digital (INTA)
instname:Instituto Nacional de Tecnología Agropecuaria
reponame_str INTA Digital (INTA)
collection INTA Digital (INTA)
instname_str Instituto Nacional de Tecnología Agropecuaria
repository.name.fl_str_mv INTA Digital (INTA) - Instituto Nacional de Tecnología Agropecuaria
repository.mail.fl_str_mv tripaldi.nicolas@inta.gob.ar
_version_ 1877227359335088128
score 13.265058