Cerrando la brecha entre análisis de vulnerabilidad de software y tolerancia ante fallos en hardware mediante duplicación selectiva

Autores
Cantagallo, Mateo
Año de publicación
2025
Idioma
español castellano
Tipo de recurso
tesis de grado
Estado
versión publicada
Colaborador/a o director/a de tesis
Mocskos, Esteban Eduardo
Unsal, Osman
Descripción
Los errores silenciosos inducidos por fallos transitorios son una preocupación creciente en el cómputo de alto desempeño (HPC) a medida que las cargas de trabajo y las plataformas escalan día a día. A diferencia de los fallos con caída, las corrupciones silenciosas de datos (SDC) pueden propagarse sin ser detectadas durante mucho tiempo, lo que conlleva esfuerzos de recuperación costosos. Se han desarrollado técnicas de tolerancia a fallos tanto a nivel de software como de hardware para mitigar estos errores. Los mecanismos de protección basados en hardware pueden detectar estos fallos de manera temprana y evitar recuperaciones complejas, pero por lo general aplican la protección de forma indiscriminada a cada instrucción, incurriendo en costes significativos de rendimiento y energía. Varios estudios a nivel de software han mostrado que un subconjunto de instrucciones contribuye en mayor medida a las SDC en presencia de fallos; algunas instrucciones enmascaran la mayoría de sus fallos, mientras que otras son muy sensible. Por lo tanto, el enfoque indiscriminado en hardware resulta ineficiente en el uso de recursos. Los esquemas de protección basados en software pueden aprovechar esta selectividad sobre secciones críticas, pero al requerir que el binario incorpore la lógica de detección, introducen costes notables al interrumpir optimizaciones y exigir una recuperación costosa. Proponemos una extensión mínima de hardware que permite que los mecanismos de protección en hardware aprovechen instrucciones críticas identificadas por software. Nuestro enfoque no introduce una nueva estrategia de duplicación; más bien, demuestra cómo integrar la duplicación selectiva de instrucciones en métodos existentes de tolerancia a fallos basados en hardware. Mostramos que incorporar información de criticidad provista por software en la protección de hardware logra mejoras sustanciales de rendimiento, manteniendo una alta cobertura de fallos críticos, reduciendo así el costo de la resiliencia en sistemas HPC.
Transient fault–induced silent errors are an increasing concern in High-Performance Computing (HPC) as workloads and platforms scale day to day. Unlike crashes, faults that result in Silent Data corruption can propagate undetected errors throughout a workload for considerable time before they are detected, resulting in costly recovery efforts. Fault tolerance techniques have been developed at both the software and hardware levels to mitigate these errors. Existing hardware-based protection mechanisms can detect this faults early and avoid complex recovery efforts, but generally apply protection indiscriminately to every instruction, incurring significant performance and energy costs. Several software-level studies have shown that a subset of instructions are the biggest contributors to SDC in the presence of faults, some instructions are able to mask most of their faults while others are very sensitive to them. Therefore, the hardware based indiscriminate approach to protection presents an inefficient use of resources. Software based protection schemes can take advantage of this selective protection of critical sections, but since the binaries need to have the detection logic themselves, these approaches bring significant costs by both disrupting optimizations and requiring expensive recovery logic. We propose a minima hardware extension that enables hardware protection mechanisms to leverage software-identified critical instructions. Our approach does not introduce a new duplication strategy; rather, it demonstrates how selective instruction duplication can be integrated into existing hardware-based fault tolerance methods. We show that incorporating software-provided criticality information into hardware protection achieves substantial performance improvements while maintaining high coverage of critical faults, thereby reducing the cost of resilience in HPC systems.
Fil: Cantagallo, Mateo. Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales; Argentina.
Materia
TOLERANCIA A FALLOS
HPC
PROTECCION SELECTIVA
ERRORES TRANSITORIOS
SDC
FAULT TOLERANCE
HPC
SELECTIVE PROTECTION
TRANSIENT ERRORS
SDC
Nivel de accesibilidad
acceso abierto
Condiciones de uso
https://creativecommons.org/licenses/by-nc-sa/2.5/ar
Repositorio
Biblioteca Digital (UBA-FCEN)
Institución
Universidad Nacional de Buenos Aires. Facultad de Ciencias Exactas y Naturales
OAI Identificador
seminario:seminario_nCOM000866_Cantagallo

id BDUBAFCEN_00769133d746220fb2c4d297d019e21b
oai_identifier_str seminario:seminario_nCOM000866_Cantagallo
network_acronym_str BDUBAFCEN
repository_id_str 1896
network_name_str Biblioteca Digital (UBA-FCEN)
spelling Cerrando la brecha entre análisis de vulnerabilidad de software y tolerancia ante fallos en hardware mediante duplicación selectivaCantagallo, MateoTOLERANCIA A FALLOSHPCPROTECCION SELECTIVAERRORES TRANSITORIOSSDCFAULT TOLERANCEHPCSELECTIVE PROTECTIONTRANSIENT ERRORSSDCLos errores silenciosos inducidos por fallos transitorios son una preocupación creciente en el cómputo de alto desempeño (HPC) a medida que las cargas de trabajo y las plataformas escalan día a día. A diferencia de los fallos con caída, las corrupciones silenciosas de datos (SDC) pueden propagarse sin ser detectadas durante mucho tiempo, lo que conlleva esfuerzos de recuperación costosos. Se han desarrollado técnicas de tolerancia a fallos tanto a nivel de software como de hardware para mitigar estos errores. Los mecanismos de protección basados en hardware pueden detectar estos fallos de manera temprana y evitar recuperaciones complejas, pero por lo general aplican la protección de forma indiscriminada a cada instrucción, incurriendo en costes significativos de rendimiento y energía. Varios estudios a nivel de software han mostrado que un subconjunto de instrucciones contribuye en mayor medida a las SDC en presencia de fallos; algunas instrucciones enmascaran la mayoría de sus fallos, mientras que otras son muy sensible. Por lo tanto, el enfoque indiscriminado en hardware resulta ineficiente en el uso de recursos. Los esquemas de protección basados en software pueden aprovechar esta selectividad sobre secciones críticas, pero al requerir que el binario incorpore la lógica de detección, introducen costes notables al interrumpir optimizaciones y exigir una recuperación costosa. Proponemos una extensión mínima de hardware que permite que los mecanismos de protección en hardware aprovechen instrucciones críticas identificadas por software. Nuestro enfoque no introduce una nueva estrategia de duplicación; más bien, demuestra cómo integrar la duplicación selectiva de instrucciones en métodos existentes de tolerancia a fallos basados en hardware. Mostramos que incorporar información de criticidad provista por software en la protección de hardware logra mejoras sustanciales de rendimiento, manteniendo una alta cobertura de fallos críticos, reduciendo así el costo de la resiliencia en sistemas HPC.Transient fault–induced silent errors are an increasing concern in High-Performance Computing (HPC) as workloads and platforms scale day to day. Unlike crashes, faults that result in Silent Data corruption can propagate undetected errors throughout a workload for considerable time before they are detected, resulting in costly recovery efforts. Fault tolerance techniques have been developed at both the software and hardware levels to mitigate these errors. Existing hardware-based protection mechanisms can detect this faults early and avoid complex recovery efforts, but generally apply protection indiscriminately to every instruction, incurring significant performance and energy costs. Several software-level studies have shown that a subset of instructions are the biggest contributors to SDC in the presence of faults, some instructions are able to mask most of their faults while others are very sensitive to them. Therefore, the hardware based indiscriminate approach to protection presents an inefficient use of resources. Software based protection schemes can take advantage of this selective protection of critical sections, but since the binaries need to have the detection logic themselves, these approaches bring significant costs by both disrupting optimizations and requiring expensive recovery logic. We propose a minima hardware extension that enables hardware protection mechanisms to leverage software-identified critical instructions. Our approach does not introduce a new duplication strategy; rather, it demonstrates how selective instruction duplication can be integrated into existing hardware-based fault tolerance methods. We show that incorporating software-provided criticality information into hardware protection achieves substantial performance improvements while maintaining high coverage of critical faults, thereby reducing the cost of resilience in HPC systems.Fil: Cantagallo, Mateo. Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales; Argentina.Universidad de Buenos Aires. Facultad de Ciencias Exactas y NaturalesMocskos, Esteban EduardoUnsal, Osman2025-10-27info:eu-repo/semantics/bachelorThesisinfo:eu-repo/semantics/publishedVersionhttp://purl.org/coar/resource_type/c_7a1finfo:ar-repo/semantics/tesisDeGradoapplication/pdfhttps://hdl.handle.net/20.500.12110/seminario_nCOM000866_Cantagallospainfo:eu-repo/semantics/openAccesshttps://creativecommons.org/licenses/by-nc-sa/2.5/arreponame:Biblioteca Digital (UBA-FCEN)instname:Universidad Nacional de Buenos Aires. Facultad de Ciencias Exactas y Naturalesinstacron:UBA-FCEN2026-10-01T10:19:46Zseminario:seminario_nCOM000866_CantagalloInstitucionalhttps://digital.bl.fcen.uba.ar/Universidad públicaNo correspondehttps://digital.bl.fcen.uba.ar/cgi-bin/oaiserver.cgiana@bl.fcen.uba.arArgentinaNo correspondeNo correspondeNo correspondeopendoar:18962026-10-01 10:19:49.569Biblioteca Digital (UBA-FCEN) - Universidad Nacional de Buenos Aires. Facultad de Ciencias Exactas y Naturalesfalse
dc.title.none.fl_str_mv Cerrando la brecha entre análisis de vulnerabilidad de software y tolerancia ante fallos en hardware mediante duplicación selectiva
title Cerrando la brecha entre análisis de vulnerabilidad de software y tolerancia ante fallos en hardware mediante duplicación selectiva
spellingShingle Cerrando la brecha entre análisis de vulnerabilidad de software y tolerancia ante fallos en hardware mediante duplicación selectiva
Cantagallo, Mateo
TOLERANCIA A FALLOS
HPC
PROTECCION SELECTIVA
ERRORES TRANSITORIOS
SDC
FAULT TOLERANCE
HPC
SELECTIVE PROTECTION
TRANSIENT ERRORS
SDC
title_short Cerrando la brecha entre análisis de vulnerabilidad de software y tolerancia ante fallos en hardware mediante duplicación selectiva
title_full Cerrando la brecha entre análisis de vulnerabilidad de software y tolerancia ante fallos en hardware mediante duplicación selectiva
title_fullStr Cerrando la brecha entre análisis de vulnerabilidad de software y tolerancia ante fallos en hardware mediante duplicación selectiva
title_full_unstemmed Cerrando la brecha entre análisis de vulnerabilidad de software y tolerancia ante fallos en hardware mediante duplicación selectiva
title_sort Cerrando la brecha entre análisis de vulnerabilidad de software y tolerancia ante fallos en hardware mediante duplicación selectiva
dc.creator.none.fl_str_mv Cantagallo, Mateo
author Cantagallo, Mateo
author_facet Cantagallo, Mateo
author_role author
dc.contributor.none.fl_str_mv Mocskos, Esteban Eduardo
Unsal, Osman
dc.subject.none.fl_str_mv TOLERANCIA A FALLOS
HPC
PROTECCION SELECTIVA
ERRORES TRANSITORIOS
SDC
FAULT TOLERANCE
HPC
SELECTIVE PROTECTION
TRANSIENT ERRORS
SDC
topic TOLERANCIA A FALLOS
HPC
PROTECCION SELECTIVA
ERRORES TRANSITORIOS
SDC
FAULT TOLERANCE
HPC
SELECTIVE PROTECTION
TRANSIENT ERRORS
SDC
dc.description.none.fl_txt_mv Los errores silenciosos inducidos por fallos transitorios son una preocupación creciente en el cómputo de alto desempeño (HPC) a medida que las cargas de trabajo y las plataformas escalan día a día. A diferencia de los fallos con caída, las corrupciones silenciosas de datos (SDC) pueden propagarse sin ser detectadas durante mucho tiempo, lo que conlleva esfuerzos de recuperación costosos. Se han desarrollado técnicas de tolerancia a fallos tanto a nivel de software como de hardware para mitigar estos errores. Los mecanismos de protección basados en hardware pueden detectar estos fallos de manera temprana y evitar recuperaciones complejas, pero por lo general aplican la protección de forma indiscriminada a cada instrucción, incurriendo en costes significativos de rendimiento y energía. Varios estudios a nivel de software han mostrado que un subconjunto de instrucciones contribuye en mayor medida a las SDC en presencia de fallos; algunas instrucciones enmascaran la mayoría de sus fallos, mientras que otras son muy sensible. Por lo tanto, el enfoque indiscriminado en hardware resulta ineficiente en el uso de recursos. Los esquemas de protección basados en software pueden aprovechar esta selectividad sobre secciones críticas, pero al requerir que el binario incorpore la lógica de detección, introducen costes notables al interrumpir optimizaciones y exigir una recuperación costosa. Proponemos una extensión mínima de hardware que permite que los mecanismos de protección en hardware aprovechen instrucciones críticas identificadas por software. Nuestro enfoque no introduce una nueva estrategia de duplicación; más bien, demuestra cómo integrar la duplicación selectiva de instrucciones en métodos existentes de tolerancia a fallos basados en hardware. Mostramos que incorporar información de criticidad provista por software en la protección de hardware logra mejoras sustanciales de rendimiento, manteniendo una alta cobertura de fallos críticos, reduciendo así el costo de la resiliencia en sistemas HPC.
Transient fault–induced silent errors are an increasing concern in High-Performance Computing (HPC) as workloads and platforms scale day to day. Unlike crashes, faults that result in Silent Data corruption can propagate undetected errors throughout a workload for considerable time before they are detected, resulting in costly recovery efforts. Fault tolerance techniques have been developed at both the software and hardware levels to mitigate these errors. Existing hardware-based protection mechanisms can detect this faults early and avoid complex recovery efforts, but generally apply protection indiscriminately to every instruction, incurring significant performance and energy costs. Several software-level studies have shown that a subset of instructions are the biggest contributors to SDC in the presence of faults, some instructions are able to mask most of their faults while others are very sensitive to them. Therefore, the hardware based indiscriminate approach to protection presents an inefficient use of resources. Software based protection schemes can take advantage of this selective protection of critical sections, but since the binaries need to have the detection logic themselves, these approaches bring significant costs by both disrupting optimizations and requiring expensive recovery logic. We propose a minima hardware extension that enables hardware protection mechanisms to leverage software-identified critical instructions. Our approach does not introduce a new duplication strategy; rather, it demonstrates how selective instruction duplication can be integrated into existing hardware-based fault tolerance methods. We show that incorporating software-provided criticality information into hardware protection achieves substantial performance improvements while maintaining high coverage of critical faults, thereby reducing the cost of resilience in HPC systems.
Fil: Cantagallo, Mateo. Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales; Argentina.
description Los errores silenciosos inducidos por fallos transitorios son una preocupación creciente en el cómputo de alto desempeño (HPC) a medida que las cargas de trabajo y las plataformas escalan día a día. A diferencia de los fallos con caída, las corrupciones silenciosas de datos (SDC) pueden propagarse sin ser detectadas durante mucho tiempo, lo que conlleva esfuerzos de recuperación costosos. Se han desarrollado técnicas de tolerancia a fallos tanto a nivel de software como de hardware para mitigar estos errores. Los mecanismos de protección basados en hardware pueden detectar estos fallos de manera temprana y evitar recuperaciones complejas, pero por lo general aplican la protección de forma indiscriminada a cada instrucción, incurriendo en costes significativos de rendimiento y energía. Varios estudios a nivel de software han mostrado que un subconjunto de instrucciones contribuye en mayor medida a las SDC en presencia de fallos; algunas instrucciones enmascaran la mayoría de sus fallos, mientras que otras son muy sensible. Por lo tanto, el enfoque indiscriminado en hardware resulta ineficiente en el uso de recursos. Los esquemas de protección basados en software pueden aprovechar esta selectividad sobre secciones críticas, pero al requerir que el binario incorpore la lógica de detección, introducen costes notables al interrumpir optimizaciones y exigir una recuperación costosa. Proponemos una extensión mínima de hardware que permite que los mecanismos de protección en hardware aprovechen instrucciones críticas identificadas por software. Nuestro enfoque no introduce una nueva estrategia de duplicación; más bien, demuestra cómo integrar la duplicación selectiva de instrucciones en métodos existentes de tolerancia a fallos basados en hardware. Mostramos que incorporar información de criticidad provista por software en la protección de hardware logra mejoras sustanciales de rendimiento, manteniendo una alta cobertura de fallos críticos, reduciendo así el costo de la resiliencia en sistemas HPC.
publishDate 2025
dc.date.none.fl_str_mv 2025-10-27
dc.type.none.fl_str_mv info:eu-repo/semantics/bachelorThesis
info:eu-repo/semantics/publishedVersion
http://purl.org/coar/resource_type/c_7a1f
info:ar-repo/semantics/tesisDeGrado
format bachelorThesis
status_str publishedVersion
dc.identifier.none.fl_str_mv https://hdl.handle.net/20.500.12110/seminario_nCOM000866_Cantagallo
url https://hdl.handle.net/20.500.12110/seminario_nCOM000866_Cantagallo
dc.language.none.fl_str_mv spa
language spa
dc.rights.none.fl_str_mv info:eu-repo/semantics/openAccess
https://creativecommons.org/licenses/by-nc-sa/2.5/ar
eu_rights_str_mv openAccess
rights_invalid_str_mv https://creativecommons.org/licenses/by-nc-sa/2.5/ar
dc.format.none.fl_str_mv application/pdf
dc.publisher.none.fl_str_mv Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales
publisher.none.fl_str_mv Universidad de Buenos Aires. Facultad de Ciencias Exactas y Naturales
dc.source.none.fl_str_mv reponame:Biblioteca Digital (UBA-FCEN)
instname:Universidad Nacional de Buenos Aires. Facultad de Ciencias Exactas y Naturales
instacron:UBA-FCEN
reponame_str Biblioteca Digital (UBA-FCEN)
collection Biblioteca Digital (UBA-FCEN)
instname_str Universidad Nacional de Buenos Aires. Facultad de Ciencias Exactas y Naturales
instacron_str UBA-FCEN
institution UBA-FCEN
repository.name.fl_str_mv Biblioteca Digital (UBA-FCEN) - Universidad Nacional de Buenos Aires. Facultad de Ciencias Exactas y Naturales
repository.mail.fl_str_mv ana@bl.fcen.uba.ar
_version_ 1877857580366168064
score 12.854657