# Paulo Villarroel Tapia > Resuelvo problemas complejos de sistemas públicos de salud con ingeniería de datos, analítica avanzada e inteligencia artificial: los que el análisis convencional no alcanza a tratar por volumen, por la ambigüedad del registro clínico o porque la decisión que hay detrás no tolera un error automático. Veinte años en el sistema público chileno, desde la práctica clínica hasta modelos que hoy operan a escala nacional sobre tecnología abierta. Ingeniero de datos y arquitecto de analítica avanzada e inteligencia artificial en salud pública · Ministerio de Salud de Chile — Oficina de Inteligencia y Gestión Estratégica en Salud · Santiago, Chile URL canónica: https://paulovillarroel.github.io/ Última actualización: 2026-09-06 ## Sistemas en producción - Detección de sospecha oncológica en listas quirúrgicas — MINSAL, Corte mensual y canal semanal. Clasifica ~475.000 diagnósticos por corte y deriva los casos sospechosos e indeterminados a auditoría clínica médica. Un modelo de lenguaje afinado añade el órgano afectado en código CIE-O3. - Validación de calidad del almacén de listas de espera — MINSAL, Mensual, por corte. Somete cada corte mensual a 34 pruebas automatizadas sobre la capa cruda y la transformada, deriva los registros con problemas al establecimiento que los originó y certifica lo que se publica en los reportes oficiales. Lo que no pasa las pruebas no sale. - Detección de anomalías en el Registro Nacional de Listas de Espera — MINSAL, Mensual, desde 2023. Vigila volumen, permanencia, variabilidad entre servicios y justificaciones de egreso, y notifica a los equipos de gestión local. - Deduplicación probabilística de identidades — MINSAL, En operación. Resuelve la misma persona registrada con distintos identificadores en 2,1 millones de registros, corrigiendo el sobredimensionamiento de la demanda. ## Perfil Mi trayectoria empezó donde empieza el dato: en la práctica clínica. Me titulé de enfermero en la Universidad de Chile y pasé años en unidades de hospitalización, turnos de urgencia y atención prehospitalaria en ambulancias. Ese periodo me dejó algo que ningún curso enseña: una comprensión directa de cómo interactúan el usuario y la burocracia hospitalaria, dónde se atascan los cuidados y cuánta complejidad esconde el registro clínico. A diferencia de las aproximaciones que abordan los datos sanitarios de forma puramente abstracta o computacional, mi trabajo técnico se construyó desde las fallas operacionales del cuidado directo. La transición fue deliberada: primero la gestión asistencial y la excelencia operacional, con una certificación Lean Six Sigma Black Belt en la Universidad de Chile y postítulos en Gerencia Pública, Control de Gestión Gerencial, Gestión de Procesos de Negocios y Alta Gerencia de Instituciones de Salud. Después, ingeniería y análisis predictivo, con estudios de ciencias de la computación en la Pontificia Universidad Católica de Chile y la malla completa de un MBA con especialización en Salud. Esa secuencia curricular explica el recorrido: del rediseño micro-operativo de procesos clínicos a la ciencia de datos aplicada, la arquitectura analítica ministerial y el modelamiento predictivo a escala nacional. La constante en todo el camino ha sido la misma: buscar los puntos ciegos del sistema, ahí donde los pacientes desaparecen dentro de la burocracia. ## Áreas de trabajo ### Ingeniería de datos sin clúster Decenas de millones de registros hospitalarios procesados en computadores convencionales, con motores OLAP embebidos y formatos columnares abiertos. Sin clústeres, sin licencias privativas. Claves: DuckDB, Apache Parquet, R, Python ### Analítica avanzada nacida en la práctica clínica Los modelos que funcionan no se diseñan desde la abstracción de los datos, sino desde las fallas operacionales del cuidado directo. Veinte años de ejercicio asistencial definen qué vale la pena predecir. Claves: analítica clínica, oncología, listas de espera, GES ### Inteligencia artificial en el Estado NLP sobre derivaciones clínicas, detección de anomalías y clasificación por ensamble, siempre con supervisión humana obligatoria. El algoritmo prioriza; nunca desestima solo. Claves: NLP, embeddings, GBDT, human-in-the-loop ### Alfabetización analítica del sector La salud digital no se sostiene comprando sistemas, sino formando a quienes ya conocen el dato clínico. De OpenSalud LAB a Hazla con Datos, enseñando código con registros sanitarios reales. Claves: Hazla con Datos, OpenSalud LAB, LatinR, UNAB ## Superficie técnica ### Ingeniería de datos y plataforma - Motores OLAP embebidos (DuckDB) sobre Apache Parquet - Modelamiento de almacenes de datos por capas - Pruebas de calidad de datos (Pointblank) - Orquestación de pipelines (Kestra, Docker) - Pipelines reproducibles en R y Python - Control de versiones y revisión de código ### Analítica avanzada y bioestadística - Análisis de supervivencia y riesgos proporcionales - Diferencias en diferencias - Descomposición de desigualdad y análisis de equidad - Vinculación probabilística de registros (Fellegi-Sunter, Splink) - Modelos de proyección con backtest - Inferencia y modelamiento estadístico ### Inteligencia artificial y aprendizaje automático - Clasificación por ensamble (gradient boosting, XGBoost) - Afinamiento de modelos de lenguaje (QLoRA, Llama 3.1) - Detección de anomalías multidimensional - Calibración de umbrales (índice de Youden) - Diseño human-in-the-loop - Transparencia algorítmica y auditoría de equidad ### Procesamiento de lenguaje natural - Incrustaciones textuales y similitud semántica - Extracción de entidades clínicas sobre texto libre - Mapeo ontológico (CIE-10, CIE-O3) - Expresiones regulares sanitarias - Servido local de modelos (Ollama) ### Privacidad y gobernanza de datos - k-anonimidad y l-diversidad - Pseudoanonimización en pipeline - Evaluación de impacto en protección de datos - Gobernanza bajo la Ley 21.719 ## Proyectos ### Modelo de trazabilidad y gestión activa de casos oncológicos 2014–2018 · Hospital Padre Hurtado · Servicio de Salud Metropolitano Sur Oriente Rol: Asesor de dirección y monitor de Garantías Explícitas en Salud (GES) Rediseño de procesos sin una sola licencia de software, que llevó a un hospital público al Top 5 nacional en gestión oncológica. Contexto: El escenario previo combinaba demoras prolongadas en el acceso a especialistas, retrasos críticos en la confirmación diagnóstica y un incumplimiento sistemático de los plazos legales del régimen GES. Las derivaciones en papel se estancaban en los puntos de contacto administrativo y nadie sabía dónde estaba cada paciente. Arquitectura: - Ingreso: Sospecha oncológica derivada desde atención primaria o urgencia. - Identificación: Etiqueta adhesiva fluorescente sobre la ficha y la derivación de papel: la marca viaja con el documento por todos los puntos administrativos. - Registro: Ingreso a la planilla de trazabilidad con un gestor de casos clínicos asignado y nominado. - Seguimiento: Contacto activo en cada hito: primera consulta, confirmación diagnóstica, comité oncológico y definición terapéutica. - Escalamiento: Alerta a la dirección del establecimiento ante riesgo de incumplimiento del plazo GES, antes de que venza. - Salida: Tratamiento, o derivación temprana a cuidados paliativos y alivio del dolor. Enfoque: - Rediseño completo del proceso bajo principios de gestión por procesos y atención basada en valor (Value-Based Healthcare), descartando de entrada el software propietario de alto coste. - Introducción de la figura del gestor de casos clínicos y del seguimiento longitudinal continuo de cada interconsulta, desde la sospecha hasta la definición terapéutica. - Mecanismos físicos de identificación visual inmediata —etiquetas adhesivas fluorescentes sobre fichas y derivaciones de papel— para impedir que las órdenes se estancaran en los puntos de contacto administrativo. - Diseño participativo con sobrevivientes de cáncer y personal clínico, extendiendo el objetivo desde el cumplimiento de metas administrativas hacia la humanización del proceso asistencial. Resultados: - Más de 6.000 pacientes ingresaron al sistema de trazabilidad durante el periodo de ejecución. - Tiempo a primera consulta de especialista reducido a 13 días. - El establecimiento se situó entre los cinco mejores hospitales públicos de Chile en gestión oncológica. - Lapsos sostenidos con cero garantías GES retrasadas en patologías neoplásicas. - Derivación más ágil a cuidados paliativos y alivio del dolor para pacientes en estadios avanzados. Stack: Lean Six Sigma, BPMN, Value-Based Healthcare, Gestión de casos ### Detección de anomalías en listas de espera con aprendizaje automático inverso 2023 · MINSAL · Departamento de Análisis e Información para la Gestión Rol: Científico de datos, equipo de conceptualización e implementación Clasificación invertida: en lugar de aprender lo típico, el modelo busca lo irregular en el Registro Nacional de Listas de Espera. Contexto: El Registro Nacional de Listas de Espera concentra decenas de millones de transacciones asistenciales. Los errores de codificación y las prácticas discordantes entre establecimientos quedaban invisibles dentro del volumen agregado, sin ningún mecanismo sistemático para detectarlos. Arquitectura: - Fuente: Registro Nacional de Listas de Espera, decenas de millones de transacciones asistenciales. - Agregación: La unidad de análisis no es el registro sino la serie temporal de cada establecimiento por tipo de prestación. - Ejes: Cuatro señales en paralelo: volumen de ingresos y egresos, permanencia frente a umbrales esperados, variabilidad contra establecimientos comparables, y evolución de las justificaciones de egreso. - Puntuación: Score de riesgo por establecimiento y tipo de prestación, no por registro individual. - Entrega: Dos salidas según destinatario: planilla de fiscalización para el nivel central y reportes HTML interactivos para las contrapartes hospitalarias. Enfoque: - Inversión metodológica del uso clásico de los algoritmos de clasificación: la arquitectura no busca patrones repetitivos ni comportamientos típicos, sino irregularidades operacionales y valores atípicos multidimensionales. - Supervisión continua de cuatro ejes: volumen dinámico de ingresos y egresos; distribuciones temporales de permanencia frente a umbrales biológicos y administrativos esperados; variabilidad productiva entre servicios y especialidades equivalentes; y evolución histórica de las justificaciones de egreso. - Cálculo de puntajes de riesgo por establecimiento y tipo de prestación, no sobre registros sueltos: lo que se modela es el comportamiento de cada establecimiento a lo largo del tiempo. - Salida en dos formatos según el destinatario: una planilla de fiscalización para el nivel central y reportes HTML interactivos para las contrapartes hospitalarias, que necesitan explorar sus propios casos. Resultados: - Habilita auditorías clínicas dirigidas, identificando errores de codificación y prácticas asistenciales discordantes. - Facilita la migración hacia las nuevas plataformas tecnológicas ministeriales. - Clasificado entre las cinco mejores implementaciones de inteligencia artificial en el Estado, en el encuentro de IA para la transformación pública convocado por la División de Gobierno Digital y el Ministerio de Hacienda. Stack: Detección de anomalías, R, Python, Reportería automatizada ### Clasificador oncológico de la lista de espera quirúrgica nacional 2025 · Ministerio de Salud de Chile Rol: Diseño del sistema algorítmico NLP, embeddings y árboles de gradiente para rescatar sospechas de cáncer mal clasificadas como cirugía electiva. 91,6 % de sensibilidad sobre 15.032 casos validados clínicamente. Contexto: Los pacientes con sospecha o evidencia de patología oncológica quedan clasificados en la lista de espera como cirugías generales o electivas no priorizadas, y pierden la prioridad que les corresponde. El sistema cubre por diseño los cánceres sin garantía explícita —melanoma, sarcomas, cabeza y cuello, esófago, páncreas, hepatobiliar, sistema nervioso central, endometrio—, porque los dieciséis cánceres GES ya tienen una vía garantizada propia. Son justamente los que nadie estaba contando. Arquitectura: - Extracción: Corte de la lista de espera quirúrgica nacional desde el almacén por capas, a Parquet consultado con DuckDB: ~475.000 diagnósticos. - Filtrado determinista: Expresiones regulares clínicas y mapeo ontológico sobre CIE-10 capturan los criterios inequívocos antes de que intervenga cualquier modelo. - Vectorización: Embeddings del texto libre contra centroides de diagnósticos oncológicos confirmados. El hash del texto normalizado sirve de llave de caché, así que solo se vectoriza lo nuevo. - Clasificación: Ensamble de árboles con potenciación de gradiente; el umbral se recalibra con el índice de Youden en cada reentrenamiento. - Decisión: Tres estados. Sospechoso e indeterminado se derivan de forma obligatoria a auditoría clínica médica; el modelo no cierra casos. - Entrega: Corte mensual oficial y auditable, más un canal preliminar semanal sobre la base transaccional que adelanta los casos con ~7 días de rezago. Enfoque: - Reglas de filtrado clínico y ontologías: expresiones regulares complejas y mapeo ontológico sobre códigos diagnósticos CIE-10 para capturar criterios deterministas directos en el texto libre de la derivación. - Vectorización semántica: modelos de incrustaciones textuales (embeddings) que transforman las hipótesis diagnósticas libres en representaciones vectoriales densas, midiendo distancias de similitud contra centroides de diagnósticos oncológicos confirmados. - Clasificación predictiva por ensamble: árboles de decisión con potenciación de gradiente, calibrados para procesar las descripciones ambiguas o abreviadas que efectivamente escribe la red asistencial. Los umbrales se recalibran con el índice de Youden en cada ciclo de reentrenamiento. - Capa de decisión con supervisión humana: cada interconsulta se etiqueta como sospechosa, no sospechosa o indeterminada. Los casos sospechosos e indeterminados se desvían de forma obligatoria a auditoría clínica médica. El algoritmo apoya el triaje; nunca ejecuta desestimaciones autónomas. - Dos canales de entrega: el corte mensual oficial produce la etiqueta auditable que usa la red para priorizar, y un canal preliminar semanal sobre la base transaccional adelanta los casos que el corte oficial todavía no etiquetó, bajando el rezago de unos 45 días a unos 7. - Caché de inferencia por hash: el texto libre se normaliza y su hash sirve de llave, de modo que el pipeline solo vectoriza lo que no ha visto nunca. El coste de cada corrida pasa a ser proporcional a la información nueva, no al tamaño de la tabla, y un texto idéntico siempre resuelve al mismo vector, lo que hace las corridas comparables entre sí. - Gobernanza del modelo como parte del sistema, no como anexo: evaluación de impacto en protección de datos, auditoría de equidad, documentación de transparencia algorítmica y respuesta formal a las consultas del Consejo para la Transparencia. Resultados: - Clasifica alrededor de 475.000 diagnósticos de la lista de espera quirúrgica nacional en cada corte. - Evaluado sobre 15.032 casos validados individualmente por especialistas clínicos: sensibilidad 91,6 %, especificidad 97,9 %, precisión (VPP) 82,8 % y valor predictivo negativo 99,0 %. - La etiqueta es oficial y auditable: es la que usa la red asistencial para priorizar los casos con indicios oncológicos. - Validación mensual contra el criterio de los Servicios de Salud, con nueve reportes por servicio, tiempos de espera por etapa oncológica e indicador de cirugía oncológica en 90 días o menos. - El circuito no termina en la clasificación: el contraste semanal contra la validación de cada servicio identifica registros mal consignados y gestiona su corrección en origen, con los referentes y equipos clínicos. Evaluación: - Sensibilidad: 91,6 %. Alta capacidad de rescate de patologías neoplásicas encubiertas en la demanda no priorizada. - Especificidad: 97,9 %. Mínima interferencia y bajo porcentaje de sobrediagnóstico sobre las rutas quirúrgicas electivas. - Precisión (VPP): 82,8 %. Confiabilidad operativa para el equipo médico de auditoría que evalúa las alertas emitidas. - Valor predictivo negativo: 99,0 %. Certeza analítica para descartar criterios de alarma oncológica en el lote evaluado. - Registro de validación: 15.032 casos. Cohorte validada clínicamente mediante revisión experta individualizada. - Frecuencia de ejecución: Semanal (desde 2025). Trazabilidad regular e integrada en los sistemas de gestión de la demanda quirúrgica. Stack: NLP, Embeddings, Gradient boosting, XGBoost, CIE-10, Índice de Youden, Caché por hash, Human-in-the-loop ### Extracción de topografía tumoral con un modelo de lenguaje afinado 2025–2026 · Ministerio de Salud de Chile Rol: Afinamiento y despliegue del modelo Llama 3.1 8B afinado con QLoRA para identificar el órgano afectado en cada sospecha oncológica y mapearlo a CIE-O3. 93,3 % de acierto a nivel de grupo topográfico. Contexto: El clasificador dice si hay sospecha oncológica, pero no de qué. Sin el órgano afectado, la sospecha no se puede priorizar clínicamente ni comparar entre servicios, y el texto libre de las derivaciones no usa ningún vocabulario controlado: el mismo tumor aparece escrito de veinte maneras distintas, abreviado y con faltas. Arquitectura: - Entrada: Los casos que el clasificador marcó como sospechosos, en la misma corrida. - Modelo: Llama 3.1 8B afinado con QLoRA: cuantización de cuatro bits más adaptadores de bajo rango, de modo que entrenamiento e inferencia caben en una sola GPU. - Despliegue: Servido con Ollama dentro de la infraestructura ministerial. El texto clínico no sale hacia ninguna API externa. - Normalización: La salida se mapea a códigos de topografía CIE-O3, el estándar con que se codifican los registros de cáncer. Enfoque: - Afinamiento de Llama 3.1 8B con QLoRA —cuantización de cuatro bits más adaptadores de bajo rango— de modo que el entrenamiento cabe en una sola GPU en lugar de requerir infraestructura de entrenamiento completa. - Mapeo de la salida a la Clasificación Internacional de Enfermedades para Oncología (CIE-O3), que es el estándar con el que se codifican los registros de cáncer, y no a una taxonomía inventada para el proyecto. - Servido localmente con Ollama: el texto clínico nunca sale de la infraestructura ministerial hacia una API de terceros, que es la condición para poder usarlo sobre datos de pacientes. - Encadenado al clasificador de sospecha, de modo que cada caso sospechoso recibe además el órgano probable en la misma corrida. Resultados: - 93,3 % de acierto a nivel de grupo topográfico C## de la CIE-O3. - La sospecha deja de ser una etiqueta binaria y pasa a ser accionable clínicamente: se puede derivar a la especialidad correcta. - Precedente de afinamiento de un modelo abierto dentro del Estado, sin enviar texto clínico a servicios externos. Stack: Llama 3.1 8B, QLoRA, Fine-tuning, Ollama, CIE-O3, Python ### Proyector y simulador de listas de espera 2025–2026 · Ministerio de Salud de Chile Rol: Modelamiento, calibración y simulador Proyección calibrada por Servicio de Salud, con backtest y una auditoría adversarial de 30 chequeos, más un simulador para explorar escenarios de capacidad y política de asignación. Contexto: Las decisiones sobre capacidad quirúrgica y asignación presupuestaria se toman mirando el stock actual de la lista, que solo describe el pasado. Proyectar exige modelar por separado los ingresos, los egresos y sus estacionalidades, y esas dinámicas difieren demasiado entre territorios como para que un único modelo nacional sirva. Arquitectura: - Entrada: Serie histórica de cortes mensuales, desagregada por Servicio de Salud. - Modelo: Ingresos y egresos se modelan por separado, con su estacionalidad propia: el stock es el resultado, no la variable. - Calibración: Un ajuste por Servicio de Salud en lugar de un modelo nacional único, porque las dinámicas territoriales no son comparables. - Verificación: Backtest sobre cortes históricos y una auditoría adversarial de 30 chequeos diseñada para romper el modelo. - Salida: Simulador en el navegador donde quien decide mueve supuestos de capacidad y política de asignación. Enfoque: - Calibración por Servicio de Salud en lugar de un modelo nacional único, porque las dinámicas de ingreso y egreso no son comparables entre territorios. - Backtest sobre cortes históricos para medir el error de proyección contra lo que efectivamente ocurrió, en vez de reportar solo el ajuste dentro de muestra. - Auditoría adversarial de 30 chequeos, diseñada explícitamente para intentar romper el modelo antes de que lo haga la realidad. - Simulador en el navegador que permite a quien decide mover supuestos de capacidad y política de asignación y ver el efecto, sin intermediación analítica. Resultados: - Traslada la conversación desde el stock actual hacia la trayectoria esperada de la lista. - El simulador pone el modelo directamente en manos de quien toma la decisión, que es donde los supuestos se discuten de verdad. Stack: R, Backtesting, Simulación, JavaScript ### Anonimización de datos clínicos con k-anonimidad y l-diversidad 2024–2026 · Ministerio de Salud de Chile Rol: Diseño e implementación de la librería Librería en R que implementa la norma técnica ministerial para liberar bases de lista de espera sin abrir la puerta a la reidentificación. Contexto: Las solicitudes de transparencia y la publicación de datos abiertos obligan a entregar bases reales. Quitar el identificador no basta: la combinación de edad, comuna, especialidad y fecha basta para reidentificar a una persona en cualquier grupo pequeño, y en salud el atributo sensible es el diagnóstico. Arquitectura: - Clasificación de campos: Cada columna se declara como identificador directo, cuasi-identificador o atributo sensible. En salud el atributo sensible es el diagnóstico. - Generalización: Degradación iterativa de niveles sobre los cuasi-identificadores, un paso a la vez, en lugar de una pasada única que generaliza de más. - Verificación: Se comprueba k sobre cada clase de equivalencia y l sobre la diversidad del atributo sensible dentro de cada clase. - Compuerta: Si la salida no alcanza el umbral, no se exporta. La decisión es del código, no del criterio de quien entrega. Enfoque: - Implementación de k-anonimidad y l-diversidad, dos modelos formales de privacidad: cada combinación de cuasi-identificadores debe repetirse al menos k veces, y cada grupo debe contener al menos l valores distintos del atributo sensible. - Degradación iterativa de los niveles de generalización hasta alcanzar el umbral, en lugar de una sola pasada que generaliza de más y destruye la utilidad del dato. - Verificación de la salida antes de exportar: si la base no cumple el umbral, no se entrega. - Incluye una propuesta de ajuste a la norma técnica ministerial, escrita desde la implementación y no desde la teoría. Resultados: - Librería base publicada como repositorio abierto, reutilizable por cualquier institución sujeta a la misma norma. - Sostiene las entregas de transparencia sobre bases de lista de espera, con un criterio explícito y verificable en vez de un juicio caso a caso. Stack: R, k-anonimidad, l-diversidad ### Deduplicación probabilística y vinculación de registros a escala nacional 2023–2026 · Ministerio de Salud de Chile Rol: Implementación de los modelos de vinculación Unificar identidades fragmentadas para saber cuánta demanda quirúrgica existe realmente. Contexto: La multiplicidad de llaves identificatorias distorsiona la base de datos asistencial. Personas migrantes en tramitación de visado, recién nacidos y personas indocumentadas ingresan bajo identificadores numéricos transitorios y luego reciben su Rol Único Nacional definitivo, sin que el sistema unifique automáticamente sus eventos asistenciales. Arquitectura: - Fuente: 2,1 millones de registros con múltiples llaves identificatorias por persona. - Motor: Splink sobre DuckDB, en proceso: la comparación por bloques corre en el mismo equipo, sin clúster. - Comparación: Similitud de Jaro-Winkler sobre nombre, fecha de nacimiento, sexo y domicilio, ponderada bajo el marco de Fellegi-Sunter. - Selección de modelo: Se entrenan 40 configuraciones candidatas y se retiene la que separa más limpiamente coincidencias de no coincidencias, medido con el dip de Hartigan sobre la distribución de puntajes. - Salida: Identidades unificadas que corrigen el conteo de demanda quirúrgica real. Enfoque: - Vinculación probabilística de registros bajo el marco de Fellegi-Sunter, implementada con Splink sobre DuckDB, para resolver 2,1 millones de registros sin salir de un equipo convencional. - Comparación de nombres, fechas de nacimiento, sexo y domicilios con métricas de distancia léxica —similitudes de Jaro-Winkler— combinadas con la ponderación probabilística del marco. - Selección de modelo por búsqueda: se entrenan 40 configuraciones candidatas y se retiene la que produce la separación más limpia entre coincidencias y no coincidencias, medida con el dip de Hartigan sobre la distribución de puntajes. Resultados: - Corrección del sobredimensionamiento de las listas de espera quirúrgicas causado por registros redundantes. - Indicadores objetivos de demanda real que sustentan la asignación presupuestaria sectorial y las políticas públicas del Ministerio de Salud. Stack: Record linkage, Fellegi-Sunter, Splink, DuckDB, Jaro-Winkler, Dip de Hartigan, Python ### Arquitectura analítica sobre tecnologías abiertas 2021–2026 · Ministerio de Salud de Chile · comunidad LatinR Rol: Arquitectura analítica y transferencia técnica Decenas de millones de filas consultadas en equipos convencionales, con motores OLAP embebidos y sin licencias privativas. Contexto: Desarrollar soluciones sobre bases de decenas de millones de transacciones hospitalarias dentro del aparato estatal choca con limitaciones recurrentes: equipos informáticos con poca memoria física y servidores centrales saturados. La respuesta habitual —comprar licencias y clústeres— no era viable. Arquitectura: - Almacenamiento: Formato columnar Apache Parquet sobre almacenamiento compartido, en lugar de una base servida. - Motor: DuckDB en proceso, corriendo en el propio equipo del analista: decenas de millones de filas sin clúster ni servidor. - Capas y compuerta: Capa cruda (bronce) y capa transformada (plata), con 34 pruebas automatizadas de Pointblank sobre ambas. Es una compuerta, no un informe: lo que no pasa las pruebas no se publica y vuelve al establecimiento que lo originó. - Ejecución: Un script de arranque único por proyecto, con la fecha de corte como parámetro, orquestado por Kestra sobre Docker. - Exploración: DuckDB compilado a WebAssembly consulta los mismos Parquet desde el navegador, sin backend que levantar ni base que exponer. - Trazabilidad: Git y GitHub Flow con revisión de pull requests: cada cambio de criterio queda fechado y atribuido. Enfoque: - DuckDB y almacenamiento columnar en Apache Parquet: implementación pionera de motores OLAP embebidos (in-process) que permiten consultar tablas de decenas de millones de filas de pacientes directamente en computadores convencionales de la red asistencial, sin clústeres externos ni superar los límites de RAM. - R para el modelamiento estadístico, el análisis de supervivencia y los reportes reproducibles con Quarto y Shiny; Python para los pipelines de producción, la vectorización de lenguaje natural y el entrenamiento de modelos de clasificación. - Prácticas de ingeniería de software dentro de dependencias gubernamentales: Git, GitHub Flow con revisión de pull requests, Bash, entornos Linux y repositorios versionados, garantizando la reproducibilidad metodológica y la auditabilidad formal de las estimaciones ministeriales. - Un esqueleto de proyecto común para toda la unidad —estructura de carpetas, rutas configurables, script de ejecución único— de modo que cualquier repositorio se levanta y se corre igual, y las convenciones quedan escritas en vez de vivir en la cabeza de alguien. - Validación de calidad del almacén como compuerta previa a la publicación: 34 pruebas automatizadas con Pointblank sobre la capa cruda y la transformada, que derivan a los establecimientos los registros con problemas y certifican lo que sale en los reportes oficiales. - Orquestación de los pipelines con Kestra sobre Docker, encadenando la ejecución de cada proyecto y el depósito de resultados sin intervención manual. - Exploración interactiva sin servidor: DuckDB compilado a WebAssembly consulta archivos Parquet servidos como estáticos, de modo que el motor analítico corre en el navegador de quien consulta. No hay backend que levantar ni base de datos que exponer, en una institución donde ambas cosas cuestan meses de tramitación. Resultados: - Reducción de la dependencia fiscal de licencias de software privativo. - Capacidad analítica habilitada directamente en los equipos locales de la red asistencial. - Arquitectura transferida activamente a la comunidad regional a través de LatinR (2021, 2024, 2025 y 2026) y de la conferencia internacional useR! 2022. Stack: DuckDB, DuckDB-WASM, Apache Parquet, R, Quarto, Shiny, Python, Kestra, Docker, Pointblank ## Aplicaciones ### Atenciones de urgencia respiratorias Visualizador de las atenciones de urgencia respiratorias en Chile por semana epidemiológica, sobre los datos abiertos del DEIS, con actualización diaria automática. Stack: Next.js, Datos abiertos DEIS, GitHub Actions, GitHub Pages Estado: En producción · repositorio público Enlaces: https://paulovillarroel.github.io/atenciones-urgencia/ · https://github.com/paulovillarroel/atenciones-urgencia ### Autoevaluación de gobernanza de datos Instrumento de autodiagnóstico de madurez en protección y gobernanza de datos para instituciones públicas, alineado a la Ley 21.719 y al Modelo de Gestión de Datos del Estado. Corre íntegramente en el navegador: ninguna respuesta sale del equipo de quien lo aplica. Stack: TypeScript, Ley 21.719, MGDE, Cliente puro Estado: En producción · repositorio público Enlaces: https://paulovillarroel.github.io/levantamiento-gobierno-datos/ · https://github.com/paulovillarroel/levantamiento-gobierno-datos ### anonimizacion-datos Librería en R que implementa k-anonimidad y l-diversidad sobre la norma técnica ministerial, con degradación iterativa de niveles y verificación de la salida antes de exportar. Stack: R, k-anonimidad, l-diversidad Estado: Repositorio público Enlaces: https://github.com/paulovillarroel/anonimizacion-datos ### Flowy Tablero Kanban para equipos que toman decisiones en reuniones: registra los acuerdos con responsable asignado, no solo las tareas. Incluye recurrencias, dependencias bloqueantes, resumen ejecutivo semanal y panel de administración. Stack: Next.js, PostgreSQL, API REST, Servidor MCP, Vercel Estado: En producción · repositorio privado Enlaces: https://flowy-team.app ### hazlacondatos.com Plataforma de la escuela: catálogo de cursos, material de las cohortes y los tutoriales interactivos, publicados como sitio estático. Stack: Astro, MDX Estado: En producción Enlaces: https://hazlacondatos.com/ ### Cosmic Locket Gestor personal de fuentes: guarda enlaces, publicaciones y documentos con búsqueda de texto completo, captura desde el navegador y desde el móvil. Herramienta propia para el trabajo docente. Stack: Next.js, Supabase, PWA Estado: En desarrollo · uso personal Enlaces: https://cosmic-locket.vercel.app ## Programa estratégico 2026 Oficina de Inteligencia y Gestión Estratégica en Salud — Desde septiembre de 2026 Desde el 1 de septiembre de 2026 integro el nuevo departamento radicado en la Oficina de Inteligencia y Gestión Estratégica en Salud del Ministerio de Salud de Chile. La oficina centraliza el trabajo técnico de un equipo multidisciplinario de 45 profesionales en torno a siete proyectos estratégicos de modernización sectorial, con la interoperabilidad sanitaria del país como meta al año 2030. 1. Receta Digital Nacional: Normalización y digitalización integral del flujo de emisión y despacho de fármacos. 2. Historia Clínica Compartida e Interoperabilidad: Plataforma para que el historial clínico de cada persona acompañe de forma segura su recorrido por la red asistencial pública y privada. 3. Transformación Digital de Listas de Espera: Uso intensivo de herramientas analíticas, optimización de flujos e inteligencia artificial para descongestionar la demanda de consultas y cirugías. 4. Nuevo Sistema Nacional de Inmunizaciones: Registro digital unificado y trazabilidad continua del plan nacional de vacunas. 5. Mapa Sanitario: Plataforma de geointeligencia y estructuración de la oferta y capacidad de la red asistencial. 6. Trazabilidad de Medicamentos: Monitorización de la cadena de suministro, almacenamiento y dispensación de medicamentos en los establecimientos de salud. 7. Portal Ciudadano de Salud Digital: Interfaz unificada de acceso del paciente a su información médica, citas y trámites en el sistema público. ## Doctrina técnica ### Una lista de espera es una cohorte censurada, no un inventario Contar a quienes siguen esperando describe a los sobrevivientes del proceso, no a la demanda. La lista de espera solo contiene a quien todavía está en ella. Quienes egresaron —por atención, por resolución en otro punto de la red, por desistimiento o por fallecimiento— desaparecen del corte. Medir el tiempo de espera promedio sobre esa foto es medir a los que aún no salen, que es precisamente el subgrupo con esperas más largas. El tratamiento correcto es de análisis de supervivencia: el egreso es el evento, la permanencia es el tiempo a evento, y quien sigue esperando al cierre del periodo está censurado por la derecha, no ausente. Sin esa corrección, las series temporales de espera parecen mejorar cuando en realidad solo cambió la composición de la cohorte. La consecuencia práctica es presupuestaria: la demanda real y la demanda visible no coinciden, y las decisiones de asignación se toman sobre la segunda. Dónde se sostiene: Proyector y simulador de listas de espera ### Interoperabilidad no es pasar un JSON El transporte es la parte fácil. Lo difícil es que las dos partes signifiquen lo mismo. Intercambiar mensajes entre dos sistemas es un problema resuelto hace décadas. Que el mensaje sea interpretable es otra cosa: exige terminologías mapeadas, unidades declaradas, vocabularios controlados y una definición compartida de qué cuenta como un diagnóstico, una atención o un episodio. A eso se suma la identidad. Si el mismo paciente resuelve a dos llaves distintas en cada extremo, un intercambio perfectamente formado produce dos historias clínicas paralelas para una sola persona. La vinculación de identidades es un prerrequisito de la interoperabilidad, no un detalle posterior. Un JSON bien formado con semántica ambigua transporta datos que no se pueden agregar, comparar ni auditar. La interoperabilidad se mide en si dos instituciones pueden sumar sus cifras sin negociarlas, no en si sus endpoints responden 200. Dónde se sostiene: Deduplicación probabilística y vinculación de registros ### La Ley 21.719 es un requisito de arquitectura, no de papeleo Tratar el dato de salud como dato sensible cambia el diseño del pipeline, no solo el anexo legal. La nueva ley chilena de protección de datos personales sitúa los datos de salud en la categoría de datos sensibles, con exigencias reforzadas de base de licitud, finalidad determinada, minimización y trazabilidad del tratamiento. Institucionalmente se suele leer como un asunto de consentimientos y formularios. Técnicamente implica otra cosa: pseudoanonimización dentro del pipeline y no al final, separación entre las llaves identificatorias y los atributos clínicos, control de acceso por rol sobre las tablas intermedias, y un registro auditable de qué consulta tocó qué dato y con qué justificación. Diseñar eso desde el principio es barato. Retrofitearlo sobre un almacén analítico que ya mezcló identificadores con variables clínicas es caro, y en la práctica suele terminar en la restricción del acceso a los propios equipos que necesitan el dato para gestionar. Dónde se sostiene: Anonimización con k-anonimidad y l-diversidad ### Un modelo que prioriza no puede desestimar Si el algoritmo puede sacar a alguien de la lista sin que un médico lo mire, el error deja de ser recuperable. Un clasificador clínico comete dos errores que no cuestan lo mismo. Un falso positivo gasta tiempo de auditoría médica, que es caro pero acotado. Un falso negativo devuelve a un paciente con cáncer a la cola general, donde nadie va a volver a mirarlo, y el coste lo paga una persona. Por eso el sistema etiqueta tres estados y no dos. Sospechoso e indeterminado se derivan de forma obligatoria a revisión médica; el algoritmo nunca cierra un caso por su cuenta. La categoría intermedia no es una debilidad del modelo: es el lugar donde se deposita explícitamente lo que el modelo no sabe. La consecuencia de diseño es que el umbral no se optimiza para exactitud global. Se calibra para que el error caro sea el que el sistema comete menos, aceptando de entrada más trabajo de auditoría. Esa es una decisión clínica antes que estadística, y por lo tanto no la puede tomar el modelo. Dónde se sostiene: Clasificador oncológico de la lista de espera quirúrgica ### Una cifra de política pública sin pipeline detrás es una opinión Si el número no se puede reproducir, la decisión que se tomó con él no se puede defender. Las cifras de lista de espera sostienen asignación presupuestaria, metas sanitarias y compromisos con la red asistencial. Cuando salen de una planilla que alguien armó a mano, no hay forma de explicar por qué el dato de marzo no cuadra con el de febrero, ni de distinguir un cambio real de un cambio de criterio. La solución no es documentar más. Es que detrás de cada cifra haya un pipeline versionado, con la fecha de corte como parámetro explícito, pruebas de calidad sobre las capas del almacén, y un repositorio donde cada cambio de criterio quede fechado y atribuido a alguien. Eso convierte la reproducibilidad en un mecanismo de rendición de cuentas y no en una virtud metodológica. Cuando alguien pregunta de dónde salió el número, la respuesta deja de ser una explicación y pasa a ser un commit. Dónde se sostiene: Arquitectura analítica sobre tecnologías abiertas ## Cronología 2004–2026 ### 2026 — Oficina de Inteligencia y Gestión Estratégica en Salud Ámbito: Dirección y estrategia digital Institución: MINSAL · Hoja de ruta digital Integración, desde el 1 de septiembre, al equipo del nuevo departamento ministerial, participando en el plan estratégico de siete proyectos para la transformación digital e interoperabilidad del sistema público hacia 2030. ### 2026 — Instructor oficial de talleres en LatinR 2026 Ámbito: Formación técnica regional Institución: LatinR · hazlacondatos.com Dictado de los talleres oficiales sobre Positron y el entorno moderno de ciencia de datos en la conferencia latinoamericana de R, y lanzamiento de la cohorte Gen6 de Hazla con Datos. ### 2025 — Pipeline semanal de búsqueda de cáncer oculto en listas quirúrgicas Ámbito: IA clínica en producción Institución: MINSAL · LatinR Puesta en marcha del pipeline ministerial de inteligencia artificial para la detección de sospechas oncológicas mal clasificadas, con ejecución semanal permanente. Ponencia en LatinR 2025. ### 2024 — Fundación de Hazla con Datos y ponencia DuckDB en LatinR Ámbito: Formación e ingeniería de datos Institución: hazlacondatos.com · LatinR Creación de la plataforma educativa hazlacondatos.com y presentación en LatinR 2024 sobre bases de datos analíticas in-process (DuckDB) para la gestión masiva de listas de espera. ### 2023 — Top 5 de las mejores iniciativas de IA del Estado chileno Ámbito: IA para el sector público Institución: Gobierno Digital · Ministerio de Hacienda El modelo de detección de anomalías en listas de espera fue seleccionado entre las cinco mejores implementaciones de inteligencia artificial del Estado en el encuentro de IA para la transformación pública. ### 2022–2026 — Diplomado en Dirección y Gestión de Estrategias en Salud Digital Ámbito: Docencia de postgrado Institución: Universidad Andrés Bello (UNAB) Docente del programa de postgrado en salud digital de la Universidad Andrés Bello. ### 2022 — Trabajo aceptado en useR! 2022 Ámbito: Validación internacional Institución: useR! Conference Trabajo técnico sobre programación aplicada a la salud pública aceptado en la conferencia mundial de usuarios de R, uno de los foros de desarrollo computacional más relevantes del ámbito científico internacional. ### 2021–2026 — Consultor en inteligencia de negocios y minería de datos Ámbito: Consultoría avanzada Institución: ECRSALUD Consultoría técnica avanzada en inteligencia de negocios y minería de datos aplicada al sector salud. ### 2021 — LatinR 2021, telemedicina en Perú y Laboratorio de Gobierno Ámbito: Analítica pública internacional Institución: LatinR · MINSA Perú · LabGob Ponencia en LatinR 2021 sobre la pertinencia de que los funcionarios públicos de salud dominen la programación en R; expositor en el Congreso Internacional de Telemedicina del Ministerio de Salud de Perú; tallerista y relator de Ciencia de Datos en Salud para el Laboratorio de Gobierno de Chile en agosto. ### 2019–2020 — SmartSalud y cobertura en medios Ámbito: Extensión y prensa Institución: INACAP · InterSystems · Medios Colaboración técnica en el desafío de innovación abierta SmartSalud, articulado por INACAP e InterSystems, con difusión en Radio Universidad de Chile, FayerWayer y el Podcast Salud 4.0. ### 2019 — Premio de oncología, publicación académica y selección MIT Critical Data Ámbito: Investigación y reconocimiento Institución: CENS · MIT Critical Data · U. de Chile Junio: tres proyectos de investigación en ciencia de datos seleccionados en la convocatoria de CENS MakeHealth, la Universidad de Chile y MIT Critical Data. Julio: docente invitado en metodología LEAN para el Servicio de Salud Coquimbo. Agosto: premio al mejor trabajo de investigación en modalidad póster en el Congreso Chileno de Oncología Médica. Octubre: selección para publicación de los proyectos «Modelo de seguimiento de pacientes» y «Modelo Seis Sigma para reducción de estancias hospitalarias» por la Escuela de Salud Pública de la Universidad de Chile. ### 2018 — Creación de OpenSalud LAB Ámbito: Emprendimiento cívico Institución: OpenSalud LAB Formalización de OpenSalud LAB como laboratorio ciudadano de innovación abierta en salud, orientado al rediseño de servicios públicos y al acompañamiento de intraemprendimientos. ### 2017–2018 — Buenas Prácticas SSMSO y Congreso Internacional de Enfermería Ámbito: Distinciones de gestión Institución: SSMSO · Congreso Int. de Enfermería Segundo lugar en la Jornada de Buenas Prácticas e Innovación del Servicio de Salud Metropolitano Sur Oriente por un esquema de optimización del flujo prequirúrgico ambulatorio, y tercer lugar en el XIII Congreso Internacional de Enfermería por aplicaciones no-code aplicadas al ámbito preoperatorio. ### 2016 — Certificación Lean Six Sigma Black Belt Ámbito: Calidad operacional Institución: Universidad de Chile Acreditación profesional como Lean Six Sigma Black Belt por la Universidad de Chile. ### 2014–2018 — Sistema de trazabilidad oncológica del Hospital Padre Hurtado Ámbito: Gestión hospitalaria Institución: Hospital Padre Hurtado · SSMSO Diseño e implementación del modelo integral de seguimiento y gestión activa de casos: más de 6.000 pacientes trazados, tiempo a primera consulta reducido a 13 días e ingreso al Top 5 nacional en gestión oncológica. ### 2014 — Finalista nacional en InnovaSalud Ámbito: Innovación en redes Institución: MINSAL · DIGERA · CORFO El modelo oncológico fue la única iniciativa del Hospital Padre Hurtado seleccionada para presentación presencial en el encuentro nacional InnovaSalud, quedando entre los 20 mejores proyectos públicos del país. ### 2004–2013 — Ejercicio clínico y jefaturas asistenciales Ámbito: Asistencial y supervisión Institución: Universidad de Chile · Red asistencial Titulación como enfermero en la Universidad de Chile y desempeño asistencial directo en unidades de hospitalización, servicios de urgencia, atención prehospitalaria en ambulancias y jefaturas clínicas. ## Formación - Licenciatura en Enfermería — Universidad de Chile (Asistencial y clínico). Conocimiento empírico de flujos hospitalarios, cuidado del paciente y registros clínicos. - Certificación Lean Six Sigma Black Belt — Universidad de Chile (Optimización operativa). Métodos cuantitativos DMAIC, reducción de varianza y rediseño de procesos críticos. - Diplomado en Control de Gestión Gerencial — Universidad de Chile (Control y planificación). Sistemas de medición estratégica, tableros de control y rendición de cuentas. - Gerencia Pública y Alta Gerencia de Instituciones de Salud — Diversas instituciones (Dirección pública). Gobernanza sectorial, marcos regulatorios y asignación presupuestaria pública. - Ciencias de la computación · MBA con especialidad en Salud (malla completada) — Pontificia Universidad Católica de Chile (Computación y negocios). Algoritmos, programación estructurada y sostenibilidad de proyectos tecnológicos. ## Reconocimientos - 2023: Top 5 de las mejores implementaciones de IA en el Estado — División de Gobierno Digital · Ministerio de Hacienda - 2022: Trabajo técnico aceptado en la conferencia mundial de usuarios de R — useR! 2022 - 2019: Mejor trabajo de investigación, modalidad póster — Congreso Chileno de Oncología Médica - 2019: Selección para publicación: modelo de seguimiento de pacientes y modelo Seis Sigma — Escuela de Salud Pública, Universidad de Chile - 2019: Tres proyectos de investigación en ciencia de datos seleccionados — CENS MakeHealth · U. de Chile · MIT Critical Data - 2017–2018: 2.° lugar en Buenas Prácticas e Innovación · 3.er lugar en el XIII Congreso Internacional de Enfermería — SSMSO · Congreso Internacional de Enfermería - 2014: Top 20 nacional de iniciativas públicas en InnovaSalud — MINSAL · DIGERA · CORFO ## Iniciativas de formación ### Diplomado en Salud Digital, UNAB (2022) Docencia de postgrado en dirección y gestión de estrategias en salud digital. Docente del Diplomado en Dirección y Gestión de Estrategias en Salud Digital de la Universidad Andrés Bello, dirigido a profesionales que van a conducir procesos de transformación digital dentro de instituciones de salud. ### Hazla con Datos (2024) — https://hazlacondatos.com/ Material de análisis de datos construido sobre datos sanitarios abiertos en lugar de casos de mercadotecnia. La analítica se enseña casi siempre con ejemplos de mercadotecnia, logística comercial o finanzas. Para el personal sanitario eso introduce una fricción metodológica concreta: el procedimiento puede ser correcto, pero la estructura del dato no se parece a la que manipulan en su trabajo. El material de Hazla con Datos se construyó sobre datos sanitarios abiertos —REM, DEIS, datos.gob.cl—, que son registros administrativos reales y no conjuntos de ejemplo: traen los mismos problemas de codificación, calidad y volumen que el personal enfrenta en su trabajo. ### OpenSalud LAB (2018) — https://opensaludlab.org/ Bootcamp abierto de ciencia de datos en salud, con todo el material en un repositorio público. OpenSalud LAB nació en 2018 como laboratorio ciudadano de innovación abierta en servicios públicos de salud. Su desarrollo principal fue el bootcamp de Ciencia de Datos en Salud, alojado íntegramente en un repositorio público de GitHub. El programa reunió más de 100 horas de formación audiovisual y más de 200 horas de recursos prácticos, con módulos de programación en R, análisis exploratorio, modelamiento estadístico, gestión de procesos y reproducibilidad técnica, desarrollados junto a R-Ladies Concepción y Data UC de la Pontificia Universidad Católica de Chile. ## Ruta formativa de Hazla con Datos 1. Nivelación inicial — Mentalidad de código, orden de rutas de proyecto, lógica algorítmica y pseudocódigo. Entorno: Markdown · Obsidian · WSL · Bash Competencia: Estructuración lógica del pensamiento analítico, sin barreras operativas de entrada. 2. Manipulación de datos — Expresiones regulares sanitarias, procesamiento de planillas clínicas y limpieza. Entorno: R (tidyverse) · Python · Regex Competencia: Normalización de diagnósticos CIE-10 y depuración de tablas administrativas de salud. 3. Procesamiento masivo — Motores OLAP embebidos, esquemas de transformación de datos y consultas SQL. Entorno: DuckDB · SQL · Apache Parquet · dbt Competencia: Capacidad de procesar tablas de millones de atenciones en computadores personales. 4. Modelamiento estadístico — Bioestadística, inferencia, regresiones y análisis de supervivencia con machine learning. Entorno: R (survival, tidymodels) · Python (scikit-learn) Competencia: Estimación de curvas de sobrevida, riesgos proporcionales e interpretación de incertidumbre. 5. Arquitectura y NLP — Procesamiento de lenguaje natural y esquemas de pseudoanonimización. Entorno: Transformers · Docker Competencia: Extracción de entidades desde texto clínico libre y técnicas de resguardo de la confidencialidad. ## Qué construyen las cohortes - Ocupación de camas hospitalarias a partir de los datos abiertos del REM, en SQL sobre DuckDB. - Normalización de diagnósticos y prestaciones escritos en texto libre, con expresiones regulares. - Procesamiento de tablas de millones de atenciones en un computador personal, sin servidor. - Modelamiento estadístico y análisis de supervivencia sobre cohortes construidas desde datos abiertos. ## Ponencias y docencia - 2026 · LatinR 2026: Instructor oficial de los talleres sobre Positron y el entorno moderno de ciencia de datos (https://latinr.org/) - 2025 · LatinR 2025: Ponencia y participación en los paneles técnicos (https://2025.latinr.org/) - 2024 · LatinR 2024: Bases de datos in-process (DuckDB) para el manejo de macrodatos en listas de espera quirúrgicas (https://github.com/LatinR/presentaciones-latinr2024) - 2022 · useR! 2022: Trabajo técnico sobre programación aplicada a la salud pública - 2021 · LatinR 2021: Por qué los funcionarios públicos de salud deberían programar en R (https://github.com/LatinR/presentaciones-LatinR2021) - 2021 · Ministerio de Salud del Perú: Expositor en el Congreso Internacional de Telemedicina - 2021 · Laboratorio de Gobierno de Chile: Relator del taller Ciencia de Datos en Salud y tallerista en la Red de Innovadores Públicos - 2019–2026 · Innovación sanitaria, comunidades de práctica y ciencia de datos aplicada: Podcast Salud 4.0 · Acceso Salud, Radio Universidad de Chile · Dbox Radio - 2019–2020 · FayerWayer · INACAP · InterSystems: Cobertura del desafío de innovación abierta SmartSalud ## Conclusiones ### La ciencia de datos en salud rinde cuando nace de la operación clínica El tránsito desde el rol de enfermero clínico hacia el diseño de modelos de inteligencia artificial orientó los proyectos hacia problemas concretos del paciente, evitando soluciones computacionales desvinculadas de la práctica hospitalaria. ### El método no cambia; cambia la herramienta Ya sea con etiquetas fluorescentes sobre fichas de papel en el Hospital Padre Hurtado o con modelos de lenguaje y árboles de gradiente en el Ministerio de Salud, el foco ha sido siempre el mismo: rescatar a los pacientes que quedan desatendidos en la burocracia de las listas de espera. ### Procesar a escala no exige clústeres ni licencias Motores embebidos como DuckDB y prácticas de control de versiones demostraron que se pueden procesar decenas de millones de registros sanitarios con infraestructura convencional. Eso reduce la dependencia fiscal de licencias privativas y, sobre todo, pone la capacidad analítica en los equipos locales en vez de concentrarla en el nivel central. ### La sostenibilidad depende del capital humano, no del software OpenSalud LAB y Hazla con Datos parten de una premisa: la salud digital no se sostiene comprando sistemas informáticos, sino alfabetizando analíticamente al propio personal del sector para que analice, depure y use sus propios datos. ## Enlaces - LinkedIn: https://www.linkedin.com/in/paulovillarroel/ - GitHub: https://github.com/paulovillarroel - Hazla con Datos: https://hazlacondatos.com/ - OpenSalud LAB: https://opensaludlab.org/