Evaluación de machine learning: qué medir por rol
Contratar a un excelente investigador de machine learning para un rol que necesita poner modelos en producción de forma confiable es un error de encaje frecuente, y casi siempre viene de una evaluación de machine learning que trató a todos los perfiles como si fueran el mismo. Machine learning agrupa perfiles con habilidades muy distintas, y evaluarlos todos con las mismas preguntas produce señales poco útiles.
Roles de ML y sus diferencias
Investigador o científico de machine learning. Explora nuevos enfoques y arquitecturas, con foco en avanzar el estado del arte o adaptar investigación reciente a un problema específico. Se evalúa profundidad teórica y capacidad de diseñar experimentos rigurosos.
Ingeniero de machine learning. Lleva modelos desde el prototipo hasta un sistema en producción confiable, mantenible y monitoreado. Se evalúa criterio de ingeniería tanto como conocimiento de modelado.
Analista o científico de datos aplicado. Usa técnicas de machine learning para resolver problemas de negocio concretos, con foco en interpretabilidad y comunicación de resultados a audiencias no técnicas.
Especialista en MLOps. Se enfoca en la infraestructura que sostiene el ciclo de vida completo de los modelos: entrenamiento, despliegue, monitoreo y reentrenamiento.
Fundamentos que sí importan en una evaluación de machine learning
No todos los fundamentos teóricos pesan igual según el rol. Para un investigador, entender a profundidad los principios matemáticos detrás de los algoritmos es central. Para un ingeniero de ML, importa más entender cuándo y por qué un modelo falla en producción, que poder derivar sus fundamentos matemáticos desde cero.
Un criterio útil para toda evaluación de ML, sin importar el rol: pedir que expliquen cómo decidirían qué modelo o enfoque usar para un problema dado, considerando no solo precisión sino también interpretabilidad, costo computacional y facilidad de mantenimiento. La respuesta revela si la persona piensa en trade offs reales o solo conoce técnicas de forma aislada.
Datos y métricas
Evalúa cómo el candidato piensa sobre calidad de datos, no solo sobre algoritmos. Pregunta cómo detectaría si los datos de entrenamiento tienen un sesgo que podría afectar el resultado del modelo en producción, y qué haría al respecto.
Sobre métricas, pide que explique por qué elegiría una métrica de evaluación sobre otra para un problema específico, por ejemplo por qué la precisión no siempre es la métrica correcta cuando las clases están desbalanceadas. Un candidato con buen criterio distingue entre métricas técnicas del modelo y métricas de impacto real de negocio, y entiende que optimizar solo la primera puede no mover la segunda.
Puesta en producción
Para roles de ingeniería de ML o MLOps, evalúa específicamente qué pasa después de que el modelo funciona bien en pruebas. Pregunta cómo monitorearía el desempeño del modelo en producción a lo largo del tiempo, cómo detectaría si el modelo empezó a degradarse porque los datos del mundo real cambiaron, y qué proceso seguiría para reentrenar o reemplazar el modelo cuando eso ocurra.
Esta dimensión suele estar ausente en entrevistas centradas solo en teoría de modelado, y es justamente donde se distingue a alguien con experiencia real construyendo sistemas de machine learning que sobreviven en producción, no solo en un entorno de prueba controlado.
Para ver cómo evaluar específicamente perfiles enfocados en procesamiento de lenguaje, un área con particularidades propias dentro de machine learning, en test de NLP está la guía de cómo evaluar perfiles de lenguaje. El guion de la conversación técnica está en entrevista técnica de IA, y el ejercicio de código que la acompaña, en test de Python.
Una evaluación de machine learning separada por rol mide lo que cada puesto necesita, en vez de premiar al perfil más académico para un problema de producción. Si quieres definirla por rol con rúbrica, puedes agendar una demo.
Preguntas frecuentes
¿Debo evaluar programación además de conocimiento de machine learning?
Sí, casi siempre. La capacidad de implementar y depurar código es tan relevante como el conocimiento de modelado para la mayoría de los roles de machine learning aplicado.
¿Qué tan importante es la experiencia con una herramienta o framework específico?
Menos importante que el criterio general. Los frameworks cambian rápido, y alguien con buenos fundamentos y criterio de ingeniería se adapta a herramientas nuevas con relativa rapidez.
¿Cómo evalúo a alguien que viene de un doctorado sin experiencia industrial?
Presta atención especial a cómo piensa sobre llevar un modelo a producción y sobre restricciones prácticas de negocio, que suelen ser el área menos desarrollada en perfiles puramente académicos, sin que eso signifique que no puedan aprenderlo rápido.
¿Los proyectos personales o de código abierto son una buena señal?
Sí, especialmente si el candidato puede explicar con profundidad las decisiones que tomó y los problemas que enfrentó, no solo mostrar el resultado final.
¿Quieres ver Self-AI en acción?
Agenda una demo y descubre cómo tomar mejores decisiones de talento con ciencia e IA.
Artículos relacionados
Test de NLP: cómo evaluar perfiles de lenguaje
Buena parte del trabajo que antes pedía construir modelos desde cero hoy se apoya en modelos ya entrenados. Qué habilidades importan ahora y en qué proporción.

Evaluación 360: cómo diseñar un feedback que la gente sí quiera recibir
Qué competencias evaluar, cómo redactar preguntas conductuales, cómo blindar el anonimato de verdad y cómo conducir la devolución de 45 minutos. Incluye 20 preguntas listas para usar.

Evaluación de desempeño: modelos, errores comunes y cómo implementarla sin que el equipo la odie
Los 5 modelos de evaluación de desempeño comparados, los 6 errores que la convierten en un trámite y un ciclo completo de 8 semanas, calibración incluida.