Data · IA · Investigación

Motor RAG médico-aeronáutico

El motor técnico abierto detrás de la evaluación de aptitud de pilotos: arquitectura Dual-Engine (RAG air-gapped + ML) sobre datos y normativa públicos.

El motor técnico — código abierto. El producto es privado; la ingeniería que lo sostiene, no. Ver el producto (Evaluación de aptitud médica aeronáutica) →

1 estrella2026rol: autor único (proyecto universitario)estado: activo
portada procedural — capturas reales a la esperaPortada procedural del proyecto Motor RAG médico-aeronáutico.

01 Problema y contexto

Evaluar la aptitud médica de un piloto exige cruzar señales clínicas con una normativa extensa, y hacerlo de forma reproducible y trazable. Este repositorio es el motor técnico que resuelve esa parte con datos y documentos públicos, sin exponer nada comercialmente sensible.

02 Solución

Dos motores acoplados: (1) un modelo predictivo clásico estima el riesgo y (2) un motor RAG local responde citando la normativa aplicable; un «prompt puente» inyecta la salida del modelo como contexto del LLM. Todo air-gapped, para que ningún dato salga del entorno.

03 Resultados

Cifras verificables en el repositorio y su documentación:

0.65Recall en la clase de riesgo (priorizado)
0.75 · ±1.3%F1 promedio en K-Fold (k=5)
0.48F1 en la clase de riesgo

04 Cómo está construido

Arquitectura Dual-Engine: un motor RAG ejecutado localmente (air-gapped) con Ollama, Mistral-7B y embeddings vectoriales (nomic-embed-text) sobre normativa aeronáutica y médica pública (DAN 19/61/67/121/135, Manual Médico OACI 8984), integrado por un «prompt puente» con un motor predictivo de machine learning. Sigue la metodología CRISP-DM de principio a fin. Es el trabajo de ingeniería más riguroso del autor y el componente abierto sobre el que se construye el producto privado AeroFit — el producto es privado; la ingeniería que lo sostiene, no.

05 Aspectos destacados

  • Arquitectura Dual-Engine: motor RAG air-gapped (Ollama + Mistral-7B + embeddings vectoriales nomic-embed-text) acoplado a un modelo predictivo por un «prompt puente».
  • Comparativa de modelos con baseline honesto: Random Forest (ganador) vs SVM-RBF vs Regresión Logística como línea base; balanceo con SMOTE ante un desbalance 90/10.
  • Preparación de datos: imputación KNN, detección de outliers por IQR, normalización con StandardScaler, y análisis no supervisado con K-Means (k=3) + PCA para explorar estructura.
  • Validación con K-Fold (k=5): F1 promedio 0.75 (±1.3%). En la clase de riesgo prioriza Recall (0.65) sobre precisión (0.38) —F1 0.48—: en medicina el error costoso es el falso negativo. Cifras del pipeline previo a la optimización de accuracy.
  • Dataset declarado como proxy: CCHS (población general canadiense, público), no datos de pilotos. Limitación explícita, no dato oculto.

06 Limitaciones

El dataset es el CCHS (Canadian Community Health Survey), una encuesta de salud de población general canadiense, pública (Kaggle) — NO datos de pilotos reales. Es un dataset proxy, elegido ante la ausencia de datos aeromédicos abiertos, y se declara como tal: es una limitación explícita del estudio.

07 Capturas