Skip to main content
< Volver a noticias
 30.07.2026

El CNAG impulsa ClarID, un nuevo estándar de identificadores legibles para metadatos biomédicos

Investigadores del Centro Nacional de Análisis Genómico (CNAG), ubicado en el Parque Científico de la Universidad de Barcelona (PCB-UB), han desarrollado ClarID, una especificación de identificadores diseñada para facilitar la interpretación de los identificadores de sujetos y muestras biológicas en los flujos de trabajo de investigación biomédica. El trabajo, publicado en la revista Journal of Biomedical Semantics, proporciona identificadores estructurados y legibles para las personas que codifican metadatos seleccionados y que pueden utilizarse junto con los identificadores existentes.

En la investigación biomédica, uno de los retos prácticos más habituales es vincular los identificadores de sujetos y biomostres con los metadatos asociados. Los identificadores de sujetos y biomuestras suelen estar diseñados para ser únicos más que informativos. Como consecuencia, los investigadores a menudo tienen que consultar tablas externas de metadatos para comprender el contexto de una muestra, como el tejido, el ensayo o la enfermedad a la que corresponde.

Aunque algunos grandes proyectos e iniciativas específicas de un ámbito utilizan identificadores estructurados, estos sistemas suelen estar adaptados al contexto original para el que fueron creados. Para abordar esta necesidad práctica, el Grupo de Genómica Biomédica del CNAG desarrolló ClarID. En lugar de sustituir identificadores persistentes como los UUID, ClarID está pensado para utilizarse de forma complementaria.

«La motivación para crear ClarID surgió de una necesidad muy práctica», explica el Dr. Manuel Rueda, investigador del CNAG y primer autor del estudio. «Cuando trabajábamos con grandes cohortes, a menudo teníamos que consultar tablas externas de metadatos simplemente para entender a qué hacía referencia un identificador de muestra o de sujeto. ClarID se diseñó como una forma sencilla y automatizable de añadir información contextual útil a los identificadores, manteniendo al mismo tiempo identificadores persistentes como los UUID».

Dos formatos complementarios para adaptarse a diferentes necesidades de la investigación

El primero es un formato legible para las personas, con campos que varían según si el identificador representa a un sujeto o una biomuestra. En el caso de las biomuestras, el identificador incluye el proyecto, la especie, el identificador del sujeto, el tejido, el tipo de muestra, el ensayo, la condición, el punto temporal y la duración, con campos opcionales para el lote y las réplicas. Los identificadores de sujeto utilizan una estructura diferente que incluye el estudio, el identificador del sujeto, el tipo de sujeto, la condición, el sexo y el grupo de edad.

El segundo formato, conocido como stub, es una representación más compacta pensada para situaciones en las que resulta útil disponer de identificadores más cortos, como nombres de archivo, pipelines de análisis, etiquetas o flujos de trabajo con códigos QR.

ClarID va acompañado de ClarID-Tools, una implementación de código abierto en línea de comandos que permite generar, descodificar y validar identificadores a partir de archivos tabulares de metadatos mediante un libro de códigos basado en YAML. El conjunto de herramientas también admite la validación de esquemas y la generación de códigos QR, lo que facilita la integración de ClarID en los flujos de trabajo de datos de investigación.

Como demostración, los autores aplicaron ClarID-Tools a metadatos públicos del Genomic Data Commons, generando identificadores para 113.760 registros clínicos a nivel de sujeto correspondientes a 86 estudios y para 4.255 registros de bioespecímenes del proyecto TARGET-AML. El código asociado, los ejemplos y los materiales reproducibles están disponibles a través del repositorio de ClarID-Tools y de un cuaderno de Google Colab enlazado.

En conjunto, ClarID no está pensado para codificar toda la información de los metadatos ni para sustituir sistemas de gestión de información de laboratorio, repositorios de metadatos o identificadores persistentes. En cambio, proporciona un identificador complementario ligero que puede mejorar la legibilidad, apoyar la curación de metadatos y facilitar la gestión cotidiana de datos en proyectos biomédicos y de ciencias de la vida.

La especificación utiliza un libro de códigos configurable, lo que permite a los proyectos adaptarla a su propia terminología y necesidades.

» Artículo de referencia: Rueda, M., Gut, I.G. ClarID: a human-readable and compact identifier specification for biomedical metadata integration. Journal of Biomedical Semantics 17, 9 (2026). DOI: https://doi.org/10.1186/s13326-026-00349-6

» Enlace a la noticia: web del CNAG [+]