Todos los artículos
Metodología·10 min de lectura

Sesgos de la IA en reclutamiento: cómo detectarlos, medirlos y reducirlos (guía 2026)

Sesgos IA reclutamiento: las 4 fuentes (datos históricos, proxies, bucle de retroalimentación, objetivo mal planteado), 3 métricas incluida la regla de los cuatro quintos, dónde se esconden en un pipeline de sourcing con IA, 6 palancas y una auditoría en 6 pasos.

Por Raanan Haas · Contributor·Actualizado el

El sesgo de la IA en reclutamiento no es un bug que el proveedor acabará corrigiendo: es un espejo. Un modelo entrenado con tus últimos diez años de contrataciones aprende a quién has contratado — y por tanto a quién no. El caso de manual sigue siendo la herramienta de cribado de CV que Amazon abandonó en 2018 tras comprobar que penalizaba las candidaturas que contenían la palabra "women's". Ocho años después los modelos son incomparablemente mejores, pero el mecanismo sigue intacto, y ahora está regulado. Esta guía explica de dónde vienen los sesgos, cómo medirlos con tres métricas sencillas, dónde se esconden en un pipeline de sourcing con IA y cómo reducirlos sin renunciar a la herramienta.

De dónde vienen los sesgos

Cuatro fuentes, que suelen acumularse:

  1. Los datos históricos. Si tus contrataciones pasadas sobrerrepresentan un género, una escuela o una franja de edad, un modelo que aprende a reproducir tus "buenas" contrataciones reproduce también esa distribución. No discrimina por intención: optimiza el parecido con el pasado.
  2. Las variables proxy. El modelo no necesita ver el género o el origen para inferirlos. El nombre de pila, el código postal, el nombre de una universidad, una pausa de catorce meses en la carrera, un deporte practicado: cada una de esas señales correlaciona con una característica protegida, y un modelo sin restricciones las usará.
  3. El bucle de retroalimentación. La herramienta recomienda perfiles, los recruiters contactan a algunos, el modelo aprende de esas decisiones. Si los recruiters siguen las recomendaciones, el modelo confirma sus propias preferencias — y las refuerza en cada ciclo.
  4. El objetivo mal planteado. Un modelo que optimiza la "tasa de respuesta al mensaje" favorecerá a los perfiles más solicitados, es decir, los más visibles, es decir, los más conformes al estereotipo del puesto. El objetivo era neutro; el resultado no.

Tres métricas para medir, no para intuir

No se corrige un sesgo que se sospecha. Se corrige un sesgo que se ha cuantificado. Tres medidas bastan para empezar, y ninguna requiere un científico de datos:

  • La tasa de selección por grupo. En cada etapa (aparición en la herramienta, contacto, entrevista, oferta), la proporción de cada grupo que supera la etapa. Basta una tabla sencilla — siempre que alguien lleve la cuenta.
  • El ratio de impacto y la regla de los cuatro quintos. Divide la tasa de selección del grupo menos favorecido entre la del grupo más favorecido. Por debajo de 0,8, las autoridades estadounidenses consideran desde 1978 que hay presunción de impacto adverso; la ley de Nueva York sobre herramientas automatizadas de decisión de empleo obliga desde 2023 a publicar ese ratio tras una auditoría independiente. El umbral no tiene valor legal en Europa, pero es la mejor señal de alerta disponible.
  • El test contrafactual. Toma cincuenta perfiles bien clasificados, cambia únicamente el nombre de pila, o el año de nacimiento, o el nombre de la universidad, y vuelve a enviarlos. Si el score se mueve más de unos pocos puntos, has encontrado un proxy activo. Es el test más sencillo y más revelador — y el que menos se hace.

Dónde se esconden los sesgos en un pipeline de sourcing con IA

El sesgo no está concentrado en "el algoritmo". Se distribuye a lo largo de la cadena, y cada eslabón tiene el suyo:

  • La búsqueda. Un motor semántico deriva hacia el perfil "medio" del mercado para un título dado. Si el desarrollador sénior mediano es un hombre de 34 años salido de una escuela de ingeniería, los perfiles que se apartan de eso quedan más abajo — no porque sean menos competentes, sino porque son menos típicos. Describimos ese límite en nuestro artículo sobre la búsqueda booleana y la búsqueda semántica.
  • El scoring. "Años de experiencia" es un proxy de la edad. "Continuidad de carrera" es un proxy de la parentalidad. "Empresas reconocidas" es un proxy del origen social. Un score que pondera esos criterios sin decirlo es un score sesgado que no lo dice.
  • La redacción de mensajes. Un modelo que escribe "rockstar", "guerrero" o "equipo joven y dinámico" produce un vocabulario que reduce de forma medible la tasa de respuesta de ciertos grupos. Aquí el sesgo está en el tono, no en la criba.
  • La priorización. Ordenar por "actividad reciente en el perfil" favorece a quienes tienen tiempo de mantener su presencia en línea — un criterio que nada tiene que ver con el puesto.
  • El análisis de CV. Los extractores fallan más con nombres no latinos, titulaciones extranjeras y trayectorias no lineales. Un error de parsing es una exclusión silenciosa.

Reducir, no eliminar: seis palancas

Ningún sistema, humano o automático, está libre de sesgos. El objetivo realista es hacerlos visibles, medibles y corregibles. Seis palancas, de la más sencilla a la más estructural:

  1. Escribir los criterios en el brief. Un modelo que recibe "tres años de Kubernetes en producción, autonomía sobre un servicio, inglés profesional" tiene menos que adivinar que uno que recibe "perfil sénior sólido". La vaguedad es el espacio donde se instalan los proxies.
  2. Retirar los proxies de la entrada. Nombre de pila, foto, edad, dirección exacta, fechas de titulación: nada de eso es necesario para evaluar una competencia. Una herramienta que no puede enmascararlos es una herramienta que los usa.
  3. Exigir un score explicado línea a línea. Si el score dice "78/100" sin decir por qué, no puedes ni rebatirlo ni auditarlo. Un score que muestra cada criterio y su peso permite detectar el criterio que no debería haber contado — es el principio que defendemos en nuestro artículo sobre el score de matching.
  4. Revisar los veinte primeros — y sondear el final de la lista. La revisión humana de la parte alta del ranking se da por hecha. Extraer diez perfiles al azar entre los que la herramienta descartó, y comprobar que merecían serlo, es lo que revela los falsos negativos sistemáticos.
  5. Auditar cada trimestre con las tres métricas. Tasa de selección, ratio de impacto, test contrafactual — sobre los puestos cerrados del trimestre. Treinta minutos, una tabla, una decisión.
  6. Documentar y exigir lo mismo al proveedor. Pide al proveedor sus resultados de pruebas de sesgo, sus instrucciones de uso y sus limitaciones conocidas. Un proveedor que no tiene nada que mostrar no ha probado nada.

Lo que dice la ley

El Reglamento europeo de IA clasifica los sistemas usados para cribar, evaluar o dirigirse a candidatos como de alto riesgo. Para esos sistemas exige al proveedor una gobernanza de datos que incluya el examen de posibles sesgos, y al responsable del despliegue — el empleador — una supervisión humana efectiva, la información a los candidatos y la conservación de registros. El calendario de aplicación y la checklist completa están en nuestra guía del AI Act para el reclutamiento. Se suma el RGPD, que prohíbe toda decisión con efectos jurídicos basada exclusivamente en un tratamiento automatizado, y que regula estrictamente los datos sensibles de los que muchos proxies son la sombra. El mensaje de ambos textos es el mismo: la herramienta puede proponer; la persona debe poder entender, rebatir y anular.

Auditoría de sesgos en seis pasos

  1. Delimitar el perímetro. Elige de tres a cinco puestos cerrados en el trimestre, cada uno con al menos cincuenta perfiles que hayan pasado por la herramienta.
  2. Reconstruir el funnel por grupo. Para cada puesto, cuenta los perfiles aparecidos, contactados, entrevistados y contratados, desglosados por los grupos que la ley te permite observar.
  3. Calcular los ratios de impacto. En cada etapa, la tasa del grupo menos favorecido dividida entre la del grupo más favorecido. Marca todo ratio inferior a 0,8.
  4. Lanzar el test contrafactual. Cincuenta perfiles, una sola variable modificada, reenvío, diferencia de score medida.
  5. Remontar a la causa. Para cada desviación, identifica el eslabón — búsqueda, score, mensaje, priorización, parsing — y el criterio o proxy responsable.
  6. Corregir, documentar, fechar. Modifica el brief, la configuración o la herramienta, registra qué se hizo y por qué, y fija la fecha de la próxima auditoría.

El sesgo de la IA en reclutamiento no es una razón para renunciar a la IA: un recruiter humano solo está igual de sesgado, e infinitamente menos auditable. Es una razón para elegir herramientas que muestren sus criterios, medir lo que hacen y conservar la decisión. Es el sentido de la posición que desarrollamos en automatizar el sourcing sin deshumanizar el proceso. ¿Quieres ver un score que explica cada punto? Descubre cómo TrueFit 360 justifica cada criterio.