Concordancia entre métodos de imputación de genotipos
- Autores
- Raschia, Maria Agustina; Ríos, Pablo Javier; Cordoba, Marcela Elisabet; Caffaro, María Eugenia; Maizon, Daniel Omar; Demitrio, Daniel Arturo; Poli, Mario Andres
- Año de publicación
- 2026
- Idioma
- español castellano
- Tipo de recurso
- documento de conferencia
- Estado
- versión publicada
- Descripción
- Genotype imputation improves genomic coverage by combining data obtained from microarrays of different densities or platforms and inferring unassigned genotypes. This study compared three imputation strategies using a dataset of 1,153 Corriedale sheep genotyped for 54,718 SNPs, with 28.21% missing data: Random Forest (RF), Sparse Convolutional Denoising Autoencoders (SCDA), and FImpute. Random Forest was implemented using the impute() method, in 28 blocks corresponding to markers with undefined genomic positions, autosomes, and the X chromosome. The SCDA model was trained using a training (80% of the population) and a validation (20% of the population) partitions over 40 epochs, selecting the model with the lowest loss and reasonable accuracy in the validation partition. FImpute was run on all markers with defined positions, incorporating pedigree information. All three strategies achieved complete imputation of missing genotypes; FImpute additionally corrected 0.13% of assigned genotypes by detecting Mendelian errors. Comparison of the imputed genotypes showed higher concordance between RF and FImpute (63.54%) than between SCDA and FImpute (52.02%), with uniform values across autosomes and slightly higher concordance on the X chromosome. Assuming greater accuracy for FImpute, RF outperformed SCDA in this dataset. These results support further exploration of these strategies using datasets with varying proportions of missing data and masking some assigned genotypes to evaluate imputation accuracy.
La imputación de genotipos permite mejorar la cobertura genómica al combinar datos obtenidos con microarreglos de distinta densidad o plataforma e inferir genotipos no asignados. Este estudio comparó tres estrategias de imputación utilizando un dataset compuesto por genotipos de 1.153 ovinos Corriedale en 54.718 SNPs, con un 28,21% de datos faltantes: Random Forest (RF), autoencoders convolucionales dispersos para la eliminación de ruido (SCDA) y FImpute. Random forest se implementó a través del método impute(), ejecutándolo en 28 bloques correspondientes a marcadores con posición indefinida en el genoma, autosomas y cromosoma X. El modelo SCDA se entrenó usando una partición de training (80% de la población) y otra de validación (20% de la población) durante 40 epochs, seleccionándose el modelo que presentó la menor pérdida y una precisión razonable en la partición de validación. FImpute se ejecutó sobre todos los marcadores con posición definida, considerando la información de pedigree. Las tres estrategias condujeron a una imputación completa de los genotipos faltantes; FImpute, además, corrigió un 0,13% de genotipos asignados por hallar errores mendelianos. La comparación de los genotipos imputados mostró mayor concordancia entre RF y FImpute (63,54%) que entre SCDA y FImpute (52,02%), con valores uniformes en los autosomas y ligeramente superiores en el cromosoma X. Asumiendo una mayor precisión para FImpute, RF mostró mejor desempeño que SCDA en el dataset empleado. Estos resultados motivan continuar explorando estas estrategias, utilizando datasets con distintos porcentajes de datos faltantes y enmascarando algunos genotipos para evaluar la precisión en las imputaciones logradas.
Instituto de Genética
Fil: Raschia, María Agustina. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; Argentina
Fil: Raschia, María Agustina. Universidad Nacional de La Plata. Facultad de Ciencias Médicas; Argentina
Fil: Ríos, Pablo Javier. Universidad de Buenos Aires; Argentina
Fil: Ríos, Pablo Javier. Universidad Nacional de La Plata. Facultad de Ciencias Exactas; Argentina
Fil: Cordoba, Marcela Elizabet. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; Argentina
Fil: Caffaro, María Eugenia. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; Argentina
Fil: Maizon, Daniel Omar. Instituto de Tecnología Agropecuaria (INTA). Estación Experimental Agropecuaria Anguil; Argentina
Fil: Maizon, Daniel Omar. Universidad Nacional de La Pampa. Facultad de Agronomía; Argentina
Fil: Demitrio, Daniel Arturo. Instituto Nacional de Tecnología Agropecuaria (INTA). Coordinación Nacional de Relaciones Institucionales y Vinculación Tecnológica; Argentina
Fil: Demitrio, Daniel Arturo. Universidad Nacional de La Plata. Facultad de Ciencias Exactas; Argentina
Fil: Poli, Mario Andrés. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; Argentina
Fil: Poli, Mario Andrés. Universidad del Salvador. Facultad de Ciencias Agrarias y Veterinaria; Argentina - Fuente
- 55as Jornadas Argentinas de Informática e Investigación Operativa (55 JAIIO) , 18o Congreso Argentino de AgroInformática. 10 al 13 de agosto de 2026, La Plata, Argentina
- Materia
-
Genotypes
Gene Pools
Reserva Genética
Single Nucleotide Polymorphisms
Genotipos
Polimorfismo de Nucleótido Unico
Autoencoders - Nivel de accesibilidad
- acceso abierto
- Condiciones de uso
- http://creativecommons.org/licenses/by-nc-sa/4.0/
- Repositorio
.jpg)
- Institución
- Instituto Nacional de Tecnología Agropecuaria
- OAI Identificador
- oai:localhost:20.500.12123/27912
Ver los metadatos del registro completo
| id |
INTADig_244b7074fd636b148090f93412befde5 |
|---|---|
| oai_identifier_str |
oai:localhost:20.500.12123/27912 |
| network_acronym_str |
INTADig |
| repository_id_str |
l |
| network_name_str |
INTA Digital (INTA) |
| spelling |
Concordancia entre métodos de imputación de genotiposConcordance between genotype imputation methodsRaschia, Maria AgustinaRíos, Pablo JavierCordoba, Marcela ElisabetCaffaro, María EugeniaMaizon, Daniel OmarDemitrio, Daniel ArturoPoli, Mario AndresGenotypesGene PoolsReserva GenéticaSingle Nucleotide PolymorphismsGenotiposPolimorfismo de Nucleótido UnicoAutoencodersGenotype imputation improves genomic coverage by combining data obtained from microarrays of different densities or platforms and inferring unassigned genotypes. This study compared three imputation strategies using a dataset of 1,153 Corriedale sheep genotyped for 54,718 SNPs, with 28.21% missing data: Random Forest (RF), Sparse Convolutional Denoising Autoencoders (SCDA), and FImpute. Random Forest was implemented using the impute() method, in 28 blocks corresponding to markers with undefined genomic positions, autosomes, and the X chromosome. The SCDA model was trained using a training (80% of the population) and a validation (20% of the population) partitions over 40 epochs, selecting the model with the lowest loss and reasonable accuracy in the validation partition. FImpute was run on all markers with defined positions, incorporating pedigree information. All three strategies achieved complete imputation of missing genotypes; FImpute additionally corrected 0.13% of assigned genotypes by detecting Mendelian errors. Comparison of the imputed genotypes showed higher concordance between RF and FImpute (63.54%) than between SCDA and FImpute (52.02%), with uniform values across autosomes and slightly higher concordance on the X chromosome. Assuming greater accuracy for FImpute, RF outperformed SCDA in this dataset. These results support further exploration of these strategies using datasets with varying proportions of missing data and masking some assigned genotypes to evaluate imputation accuracy.La imputación de genotipos permite mejorar la cobertura genómica al combinar datos obtenidos con microarreglos de distinta densidad o plataforma e inferir genotipos no asignados. Este estudio comparó tres estrategias de imputación utilizando un dataset compuesto por genotipos de 1.153 ovinos Corriedale en 54.718 SNPs, con un 28,21% de datos faltantes: Random Forest (RF), autoencoders convolucionales dispersos para la eliminación de ruido (SCDA) y FImpute. Random forest se implementó a través del método impute(), ejecutándolo en 28 bloques correspondientes a marcadores con posición indefinida en el genoma, autosomas y cromosoma X. El modelo SCDA se entrenó usando una partición de training (80% de la población) y otra de validación (20% de la población) durante 40 epochs, seleccionándose el modelo que presentó la menor pérdida y una precisión razonable en la partición de validación. FImpute se ejecutó sobre todos los marcadores con posición definida, considerando la información de pedigree. Las tres estrategias condujeron a una imputación completa de los genotipos faltantes; FImpute, además, corrigió un 0,13% de genotipos asignados por hallar errores mendelianos. La comparación de los genotipos imputados mostró mayor concordancia entre RF y FImpute (63,54%) que entre SCDA y FImpute (52,02%), con valores uniformes en los autosomas y ligeramente superiores en el cromosoma X. Asumiendo una mayor precisión para FImpute, RF mostró mejor desempeño que SCDA en el dataset empleado. Estos resultados motivan continuar explorando estas estrategias, utilizando datasets con distintos porcentajes de datos faltantes y enmascarando algunos genotipos para evaluar la precisión en las imputaciones logradas.Instituto de GenéticaFil: Raschia, María Agustina. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; ArgentinaFil: Raschia, María Agustina. Universidad Nacional de La Plata. Facultad de Ciencias Médicas; ArgentinaFil: Ríos, Pablo Javier. Universidad de Buenos Aires; ArgentinaFil: Ríos, Pablo Javier. Universidad Nacional de La Plata. Facultad de Ciencias Exactas; ArgentinaFil: Cordoba, Marcela Elizabet. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; ArgentinaFil: Caffaro, María Eugenia. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; ArgentinaFil: Maizon, Daniel Omar. Instituto de Tecnología Agropecuaria (INTA). Estación Experimental Agropecuaria Anguil; ArgentinaFil: Maizon, Daniel Omar. Universidad Nacional de La Pampa. Facultad de Agronomía; ArgentinaFil: Demitrio, Daniel Arturo. Instituto Nacional de Tecnología Agropecuaria (INTA). Coordinación Nacional de Relaciones Institucionales y Vinculación Tecnológica; ArgentinaFil: Demitrio, Daniel Arturo. Universidad Nacional de La Plata. Facultad de Ciencias Exactas; ArgentinaFil: Poli, Mario Andrés. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; ArgentinaFil: Poli, Mario Andrés. Universidad del Salvador. Facultad de Ciencias Agrarias y Veterinaria; ArgentinaSociedad Argentina de Informática e Investigación Operativa (SADIO)2026-09-23T14:47:56Z2026-09-23T14:47:56Z2026-08info:eu-repo/semantics/conferenceObjectinfo:eu-repo/semantics/publishedVersionhttp://purl.org/coar/resource_type/c_5794info:ar-repo/semantics/documentoDeConferenciaapplication/pdfhttp://hdl.handle.net/20.500.12123/2791255as Jornadas Argentinas de Informática e Investigación Operativa (55 JAIIO) , 18o Congreso Argentino de AgroInformática. 10 al 13 de agosto de 2026, La Plata, Argentinareponame:INTA Digital (INTA)instname:Instituto Nacional de Tecnología Agropecuariaspainfo:eu-repo/semantics/openAccesshttp://creativecommons.org/licenses/by-nc-sa/4.0/Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0)2026-09-24T11:43:52Zoai:localhost:20.500.12123/27912instacron:INTAInstitucionalhttp://repositorio.inta.gob.ar/Organismo científico-tecnológicoNo correspondehttp://repositorio.inta.gob.ar/oai/requesttripaldi.nicolas@inta.gob.arArgentinaNo correspondeNo correspondeNo correspondeopendoar:l2026-09-24 11:43:53.022INTA Digital (INTA) - Instituto Nacional de Tecnología Agropecuariafalse |
| dc.title.none.fl_str_mv |
Concordancia entre métodos de imputación de genotipos Concordance between genotype imputation methods |
| title |
Concordancia entre métodos de imputación de genotipos |
| spellingShingle |
Concordancia entre métodos de imputación de genotipos Raschia, Maria Agustina Genotypes Gene Pools Reserva Genética Single Nucleotide Polymorphisms Genotipos Polimorfismo de Nucleótido Unico Autoencoders |
| title_short |
Concordancia entre métodos de imputación de genotipos |
| title_full |
Concordancia entre métodos de imputación de genotipos |
| title_fullStr |
Concordancia entre métodos de imputación de genotipos |
| title_full_unstemmed |
Concordancia entre métodos de imputación de genotipos |
| title_sort |
Concordancia entre métodos de imputación de genotipos |
| dc.creator.none.fl_str_mv |
Raschia, Maria Agustina Ríos, Pablo Javier Cordoba, Marcela Elisabet Caffaro, María Eugenia Maizon, Daniel Omar Demitrio, Daniel Arturo Poli, Mario Andres |
| author |
Raschia, Maria Agustina |
| author_facet |
Raschia, Maria Agustina Ríos, Pablo Javier Cordoba, Marcela Elisabet Caffaro, María Eugenia Maizon, Daniel Omar Demitrio, Daniel Arturo Poli, Mario Andres |
| author_role |
author |
| author2 |
Ríos, Pablo Javier Cordoba, Marcela Elisabet Caffaro, María Eugenia Maizon, Daniel Omar Demitrio, Daniel Arturo Poli, Mario Andres |
| author2_role |
author author author author author author |
| dc.subject.none.fl_str_mv |
Genotypes Gene Pools Reserva Genética Single Nucleotide Polymorphisms Genotipos Polimorfismo de Nucleótido Unico Autoencoders |
| topic |
Genotypes Gene Pools Reserva Genética Single Nucleotide Polymorphisms Genotipos Polimorfismo de Nucleótido Unico Autoencoders |
| dc.description.none.fl_txt_mv |
Genotype imputation improves genomic coverage by combining data obtained from microarrays of different densities or platforms and inferring unassigned genotypes. This study compared three imputation strategies using a dataset of 1,153 Corriedale sheep genotyped for 54,718 SNPs, with 28.21% missing data: Random Forest (RF), Sparse Convolutional Denoising Autoencoders (SCDA), and FImpute. Random Forest was implemented using the impute() method, in 28 blocks corresponding to markers with undefined genomic positions, autosomes, and the X chromosome. The SCDA model was trained using a training (80% of the population) and a validation (20% of the population) partitions over 40 epochs, selecting the model with the lowest loss and reasonable accuracy in the validation partition. FImpute was run on all markers with defined positions, incorporating pedigree information. All three strategies achieved complete imputation of missing genotypes; FImpute additionally corrected 0.13% of assigned genotypes by detecting Mendelian errors. Comparison of the imputed genotypes showed higher concordance between RF and FImpute (63.54%) than between SCDA and FImpute (52.02%), with uniform values across autosomes and slightly higher concordance on the X chromosome. Assuming greater accuracy for FImpute, RF outperformed SCDA in this dataset. These results support further exploration of these strategies using datasets with varying proportions of missing data and masking some assigned genotypes to evaluate imputation accuracy. La imputación de genotipos permite mejorar la cobertura genómica al combinar datos obtenidos con microarreglos de distinta densidad o plataforma e inferir genotipos no asignados. Este estudio comparó tres estrategias de imputación utilizando un dataset compuesto por genotipos de 1.153 ovinos Corriedale en 54.718 SNPs, con un 28,21% de datos faltantes: Random Forest (RF), autoencoders convolucionales dispersos para la eliminación de ruido (SCDA) y FImpute. Random forest se implementó a través del método impute(), ejecutándolo en 28 bloques correspondientes a marcadores con posición indefinida en el genoma, autosomas y cromosoma X. El modelo SCDA se entrenó usando una partición de training (80% de la población) y otra de validación (20% de la población) durante 40 epochs, seleccionándose el modelo que presentó la menor pérdida y una precisión razonable en la partición de validación. FImpute se ejecutó sobre todos los marcadores con posición definida, considerando la información de pedigree. Las tres estrategias condujeron a una imputación completa de los genotipos faltantes; FImpute, además, corrigió un 0,13% de genotipos asignados por hallar errores mendelianos. La comparación de los genotipos imputados mostró mayor concordancia entre RF y FImpute (63,54%) que entre SCDA y FImpute (52,02%), con valores uniformes en los autosomas y ligeramente superiores en el cromosoma X. Asumiendo una mayor precisión para FImpute, RF mostró mejor desempeño que SCDA en el dataset empleado. Estos resultados motivan continuar explorando estas estrategias, utilizando datasets con distintos porcentajes de datos faltantes y enmascarando algunos genotipos para evaluar la precisión en las imputaciones logradas. Instituto de Genética Fil: Raschia, María Agustina. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; Argentina Fil: Raschia, María Agustina. Universidad Nacional de La Plata. Facultad de Ciencias Médicas; Argentina Fil: Ríos, Pablo Javier. Universidad de Buenos Aires; Argentina Fil: Ríos, Pablo Javier. Universidad Nacional de La Plata. Facultad de Ciencias Exactas; Argentina Fil: Cordoba, Marcela Elizabet. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; Argentina Fil: Caffaro, María Eugenia. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; Argentina Fil: Maizon, Daniel Omar. Instituto de Tecnología Agropecuaria (INTA). Estación Experimental Agropecuaria Anguil; Argentina Fil: Maizon, Daniel Omar. Universidad Nacional de La Pampa. Facultad de Agronomía; Argentina Fil: Demitrio, Daniel Arturo. Instituto Nacional de Tecnología Agropecuaria (INTA). Coordinación Nacional de Relaciones Institucionales y Vinculación Tecnológica; Argentina Fil: Demitrio, Daniel Arturo. Universidad Nacional de La Plata. Facultad de Ciencias Exactas; Argentina Fil: Poli, Mario Andrés. Instituto Nacional de Tecnología Agropecuaria (INTA). Instituto de Genética; Argentina Fil: Poli, Mario Andrés. Universidad del Salvador. Facultad de Ciencias Agrarias y Veterinaria; Argentina |
| description |
Genotype imputation improves genomic coverage by combining data obtained from microarrays of different densities or platforms and inferring unassigned genotypes. This study compared three imputation strategies using a dataset of 1,153 Corriedale sheep genotyped for 54,718 SNPs, with 28.21% missing data: Random Forest (RF), Sparse Convolutional Denoising Autoencoders (SCDA), and FImpute. Random Forest was implemented using the impute() method, in 28 blocks corresponding to markers with undefined genomic positions, autosomes, and the X chromosome. The SCDA model was trained using a training (80% of the population) and a validation (20% of the population) partitions over 40 epochs, selecting the model with the lowest loss and reasonable accuracy in the validation partition. FImpute was run on all markers with defined positions, incorporating pedigree information. All three strategies achieved complete imputation of missing genotypes; FImpute additionally corrected 0.13% of assigned genotypes by detecting Mendelian errors. Comparison of the imputed genotypes showed higher concordance between RF and FImpute (63.54%) than between SCDA and FImpute (52.02%), with uniform values across autosomes and slightly higher concordance on the X chromosome. Assuming greater accuracy for FImpute, RF outperformed SCDA in this dataset. These results support further exploration of these strategies using datasets with varying proportions of missing data and masking some assigned genotypes to evaluate imputation accuracy. |
| publishDate |
2026 |
| dc.date.none.fl_str_mv |
2026-09-23T14:47:56Z 2026-09-23T14:47:56Z 2026-08 |
| dc.type.none.fl_str_mv |
info:eu-repo/semantics/conferenceObject info:eu-repo/semantics/publishedVersion http://purl.org/coar/resource_type/c_5794 info:ar-repo/semantics/documentoDeConferencia |
| format |
conferenceObject |
| status_str |
publishedVersion |
| dc.identifier.none.fl_str_mv |
http://hdl.handle.net/20.500.12123/27912 |
| url |
http://hdl.handle.net/20.500.12123/27912 |
| dc.language.none.fl_str_mv |
spa |
| language |
spa |
| dc.rights.none.fl_str_mv |
info:eu-repo/semantics/openAccess http://creativecommons.org/licenses/by-nc-sa/4.0/ Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0) |
| eu_rights_str_mv |
openAccess |
| rights_invalid_str_mv |
http://creativecommons.org/licenses/by-nc-sa/4.0/ Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0) |
| dc.format.none.fl_str_mv |
application/pdf |
| dc.publisher.none.fl_str_mv |
Sociedad Argentina de Informática e Investigación Operativa (SADIO) |
| publisher.none.fl_str_mv |
Sociedad Argentina de Informática e Investigación Operativa (SADIO) |
| dc.source.none.fl_str_mv |
55as Jornadas Argentinas de Informática e Investigación Operativa (55 JAIIO) , 18o Congreso Argentino de AgroInformática. 10 al 13 de agosto de 2026, La Plata, Argentina reponame:INTA Digital (INTA) instname:Instituto Nacional de Tecnología Agropecuaria |
| reponame_str |
INTA Digital (INTA) |
| collection |
INTA Digital (INTA) |
| instname_str |
Instituto Nacional de Tecnología Agropecuaria |
| repository.name.fl_str_mv |
INTA Digital (INTA) - Instituto Nacional de Tecnología Agropecuaria |
| repository.mail.fl_str_mv |
tripaldi.nicolas@inta.gob.ar |
| _version_ |
1877227359335088128 |
| score |
13.265058 |