Introducción a Machine Learning en Bioinformática

Curso en vivo · 12 horas

MX$899.00

Agotado

Cada semana sale una firma génica nueva que predice pronóstico, respuesta a tratamiento o subtipo molecular. Y cada tanto sale un artículo mostrando que la mayoría no replica en cohortes independientes. La diferencia entre un modelo que sirve y uno que solo se ve bien en su propio dataset no está en el algoritmo: está en decisiones que se toman antes y después de entrenarlo. Este curso es sobre esas decisiones.

Qué vas a aprender

Empiezas por entender qué tipo de problema tienes entre manos. Aprendizaje supervisado o no supervisado, y qué implica esa elección para tu pregunta biológica.

Revisas tus datos antes de modelar: outliers, valores faltantes, normalización, escalado y efectos de lote. Este último punto es el que hunde más análisis de los que se admiten, porque un lote de secuenciación puede separar tus muestras más que la propia biología, y si no lo detectas tu modelo aprende el lote.

Realizas PCA para reducir veinte mil genes a unos pocos ejes interpretables, leyendo varianza explicada y loadings en lugar de solo mirar la nube de puntos. Clustering con K-means y jerárquico, eligiendo k con criterio y evaluando si los grupos que encontraste son reales. Al final contrastas tus clusters contra los subtipos verdaderos y respondes si el transcriptoma solo ya contenía esa información.

Después entrenas clasificadores: regresión logística con regularización y random forest, sobre expresión génica. Extraes los genes que más pesan en cada modelo y aprendes a interpretarlos, que es el mismo principio detrás de las firmas génicas comerciales.

Finalmente eliges la métrica correcta según el desbalance de tus clases, montar validación cruzada bien anidada respecto al preprocesamiento, y auditar tu propio pipeline buscando data leakage.

Qué te llevas

Un notebook reproducible que va del dato crudo al modelo validado, aplicable a tus propios datos cambiando solo el bloque de carga. Y el criterio para saber cuándo un modelo, tuyo o publicado, está sostenido por algo más que su propio dataset.

MÓDULO 1. ¿Qué estructura tienen mis datos y están listos para analizarse?

Aprendizaje supervisado frente a no supervisado, y cómo decidir cuál corresponde a tu pregunta biológica. La matriz de muestras por features como formato de entrada de cualquier método de ML.

Detección de outliers y de efectos de lote en una matriz de expresión, porque un lote de secuenciación puede separar las muestras más que el propio subtipo tumoral, y si no lo detectas el modelo aprende el lote y no la biología.

Manejo de valores faltantes, normalización, justificando cada decisión en lugar de aplicarla por defecto.

MÓDULO 2. ¿Existen subgrupos naturales en mis muestras?

PCA aplicado a expresión: qué hace, cómo leer la varianza explicada, cuándo el scree plot te dice que ya no vale la pena agregar componentes.

Clustering con K-means y jerárquico, elección de la distancia (euclidiana frente a correlación) y elección de k con criterio, no por inspección visual.

Evaluación de los clusters.

MÓDULO 3. ¿Puedo predecir el fenotipo de una muestra nueva?

División estratificada en entrenamiento y prueba, y por qué la estratificación importa cuando las clases están desbalanceadas.

Entrenamiento de regresión logística con regularización L1 y L2, y de random forest, sobre datos de expresión.

Extracción e interpretación de los genes más informativos de cada modelo con feature importance y coeficientes.

MÓDULO 4. ¿Puedo confiar en mi modelo?

Elección de la métrica según el desbalance de clases de tu problema: accuracy, precision, recall, F1 y AUC-ROC, y lectura de la matriz de confusión.

Validación cruzada k-fold y estratificada, correctamente anidada respecto al preprocesamiento.

Detección de data leakage y auditoría de tu propio pipeline.

- 12 horas de formación para el análisis de datos

- Scripts para cada módulo, listos para usar

- Archivos de datos biológicos reales para la práctica

- Proyecto integrador completo para aplicar todo lo aprendido

- Material y scripts descargables

-Grabación vigente por 3 meses 

- Estudiantes y profesionales en biología, genética, biotecnología o bioinformática

- Investigadores y técnicos que quieren automatizar análisis biológicos

- Personas con base en biología sin conocimientos en programación

- Cualquier interesado en datos genómicos y análisis computacional

- Conocimientos básicos de biología

- Computadora con Windows, MacOS o Linux

- Conexión a internet para descarga de software y datos

-Tener conocimientos de programación en PYTHON

BioGenIA

Bioinformática + IA: el futuro de la ciencia empieza aquí.

Blog
Términos y condiciones
Política de reembolso

Contacto

hola@biogenia.com.mx

© 2025. All rights reserved.