Siete candidatos, uno elegido

Todos sobre los mismos datos, la misma partición agrupada por paciente y la misma validación cruzada de 5 particiones. Estos son los resultados del Modelo 1, el que decide si el tejido es tumoral.

ModeloF1-macro · CVTiempo
HistGradientBoosting 0,979 113 s
K-Nearest Neighbors 0,975 7 s
Regresión logística · L2 0,974 11 s
SVM lineal 0,974 9 s
Random Forest 0,974 47 s
Regresión logística · L1 0,968 13 s
Regresión logística · PCA 0,958 18 s

Escala de las barras: 0,950 – 0,980 · las diferencias son pequeñas

Modelo seleccionado · prueba

Regresión logística L2

SelectKBest k=3000 · C=0,05

No es el que más puntúa. Es el que explica sus decisiones y entrena once veces más rápido que el que va primero.

F1-macro
0,974
Balanced acc.
0,989
ROC-AUC
0,997
Kappa
0,949

La diferencia con el primero es de 0,0045, dentro de la desviación típica de ambos (0,008 y 0,007): no es una diferencia real. A cambio, HistGradientBoosting tarda 113 segundos frente a 11, y no permite saber qué genes pesan en cada decisión. No elegimos el más sofisticado: elegimos el que sabe explicarse.

Lo que consigue

El sistema decide en dos pasos: primero si el tejido es tumoral, y solo si lo es, de qué tipo. Estos son los resultados sobre muestras que el modelo nunca había visto.

Modelo 1 · 340 muestras

¿Tumoral o sano?
Acertó el 100% de las muestras sanas, sin un solo falso positivo, y el 97,8% de las tumorales.

F1-macro
0,974
Balanced accuracy
0,989
Modelo 2 · 268 muestras

¿Qué tipo de cáncer?
Una vez confirmado el tumor, identificó el tipo correcto en el 100% de los casos, entre cinco posibles.

F1-macro
1,000
Kappa
1,000

Un 100% pide explicación. El Modelo 2 solo distingue el órgano de origen, y cada tejido tiene un programa génico muy característico — es una tarea más fácil de lo que parece. La cifra que de verdad limita el sistema es el 97,8%: ese 2,2% de tumores que el Modelo 1 clasifica como sanos ya no llega nunca al segundo paso.

El modelo redescubrió la patología

Nadie le dijo qué buscar. Estos son los genes que más pesan en el Modelo 2, el que identifica el órgano de origen — y coinciden con los marcadores que un patólogo usa cada día.

GenImportanciaCohorte
SFTPBLUAD
NKX2-1LUAD
SFTPA1LUAD
SFTA3LUAD
MMP3BRCA
CDKL2LUAD
SFTPCLUAD
SCGB3A2LUAD
SFTPA2LUAD
NAPSALUAD
TCF21BRCA
ROS1LUAD
SCGB2A2BRCA
PRLRBRCA

Importancia global · suma de coeficientes absolutos · escala 0,100 – 0,142

Lectura biológica

Siete de los diez primeros son genes del pulmón

SFTPB, SFTPA1, SFTPA2, SFTPC y SFTA3 codifican proteínas del surfactante, que solo producen los neumocitos del alvéolo. No existen fuera del pulmón.

Y dos de ellos son, literalmente, los anticuerpos que se usan en el laboratorio para confirmar un adenocarcinoma de pulmón:

NKX2-1
Se conoce en patología como TTF-1
NAPSA
Se conoce como Napsina A
SCGB2A2
Es la mamaglobina, marcador de mama

El modelo solo vio números: 20.531 valores de expresión por muestra, sin ninguna anotación biológica. Llegó por su cuenta a los mismos marcadores que la histopatología lleva décadas usando. No es una validación clínica, pero sí una señal de que lo que aprendió tiene sentido.

OncoLens · Proyecto académico · Bootcamp Data Analyst II · 2026