La dificultad no estaba en entrenar un clasificador. Estaba en construir un sistema donde la identidad de los datos, la búsqueda de la política, la evidencia reservada, el comportamiento del servicio y la autoridad para rechazar un resultado pudieran inspeccionarse en conjunto.

El repositorio comenzó con un enfoque de preselección de candidatos. Sin embargo, sus datos son UCI Adult, un benchmark de ingresos del censo de 1994, no registros de postulantes ni de desempeño laboral. Conservé la pregunta difícil de ingeniería y reconstruí el sistema que la rodea: ¿qué evidencia debería existir antes de permitir que el puntaje de un modelo se convierta en política?

Reconstruí el proyecto alrededor de esa idea. Ahora es un laboratorio auditable de políticas para clasificación tabular sobre el benchmark UCI Adult, con Regresión Logística, Random Forest y XGBoost como modelos intercambiables de puntuación. El modelo es solo un componente. Cada ejecución también debe explicar qué registros utilizó, cómo eligió la política de decisión, qué muestran los datos reservados, si la regla de gobernanza acepta la evidencia y qué debería observar un sistema en operación.

MAPA DEL SISTEMA / ML CONFIABLETres planos mantienen inspeccionable una auditoría de equidad.El flujo vincula la identidad de los datos, la búsqueda de políticas y la evidencia del servicio sin convertir una intervención offline en una regla de servicio no revisada.
  1. Contrato de datos

    Qué puede leer la ejecución y cómo cada partición conserva su identidad.

    ENTRADA LIGADA
    1. Auditoría de datos brutosLos registros canónicos conservan los atributos protegidos necesarios para medir.
    2. Informe de calidad ligado a la huellaLos hallazgos de calidad y la tabla para el modelo resuelven a la misma identidad de datos.
    3. Límite exacto de 11 característicasSolo los campos de predicción declarados entran al modelo; los campos de auditoría quedan fuera.
    4. Partición oficialLa prueba definida por la fuente permanece sellada, separada del ajuste y la validación.
  2. Laboratorio de políticas

    Donde los puntajes se convierten en decisiones candidatas y se prueban antes de elegir.

    BÚSQUEDA + ESTRÉS
    1. PuntajesEl modelo congelado emite probabilidades antes de aplicar cualquier umbral.
    2. Frontera de Pareto exhaustiva de dos umbralesCada par de umbrales permitido se evalúa frente a objetivos de utilidad y disparidad.
    3. Banda global de revisiónUna banda compartida de incertidumbre dirige las decisiones limítrofes a revisión.
    4. Sensibilidad interseccional y al solapamientoLas intersecciones, el reajuste en validación y el solapamiento reservado con política fija reciben pruebas separadas.
  3. Gobernanza y operaciones

    Qué puede aprobarse, cargarse, servirse y mantenerse observable después de la auditoría.

    VERIFICA + OBSERVA
    1. Regla de aceptación sensible a la incertidumbreLas restricciones y los intervalos configurados determinan el veredicto, no una sola estimación.
    2. Paquete de siete archivos ligado por integridadEl manifiesto liga cada artefacto requerido y rechaza una carga que no coincida.
    3. Simulación estricta de la APIEl esquema, los dominios, las categorías y la política se ejercitan como solicitudes del servicio.
    4. Monitoreo agregadoLas tasas operativas exponen deriva y presión de revisión sin revelar registros individuales.
COLUMNA DE CONTROL DE EXTREMO A EXTREMOUna sola traza cruza los tres planos.
  1. Identidad de datos
  2. Evidencia de calidad
  3. Política elegida
  4. Veredicto de la regla
  5. Señales operativas

Leer primero el resultado publicado

El estudio de referencia repite el flujo completo de XGBoost con cinco semillas. No selecciona la ejecución más conveniente. Cada ejecución vuelve a construir la división de ajuste y validación, busca la política, evalúa el resultado fijo sobre la misma partición oficial de prueba y pasa por una comprobación estricta de comparabilidad antes de agregarse.

EJECUCIONES COMPARABLES5Semillas de 0 a 4
POLÍTICAS CANDIDATAS10.201Pares de umbrales por semilla
BOOTSTRAPS PAREADOS500Por semilla
GOBERNANZA0 / 5Paquetes aceptados
FILAS PARA EL MODELO45.222Desde 48.842 filas brutas
SOLAPAMIENTO EN PRUEBA3.581Identidades exactas aisladas

Entre las cinco semillas, la mediana de exactitud ajustada fue 0,8689, con un rango de 0,8649 a 0,8709. La mediana de impacto dispar fue 0,3657, con un rango de 0,3142 a 0,4146; la mediana de la diferencia de tasas de selección fue 0,1754, con un rango de 0,1236 a 0,1808; y la mediana de la brecha con signo de verdaderos positivos fue 0,0368, con un rango de -0,0233 a 0,0849. Cada informe fue estructuralmente válido y cada uno fue rechazado por la regla configurada. Esa separación entre un artefacto válido y un resultado de política inaceptable es el resultado central.

Las cinco semillas reutilizan la misma partición oficial de prueba. Su dispersión mide la sensibilidad a la división entre ajuste y validación, al entrenamiento del modelo y a la selección de la política, no cinco muestras independientes de una población objetivo.

El benchmark también contiene una repetición sustancial de identidades. 3.581 de 15.060 filas reservadas comparten la identidad exacta de las 11 características con una fila de ajuste o validación. La vista de identidades nuevas mantiene fija la política, conserva 11.479 filas y se informa junto con la evaluación principal, sin cambiar silenciosamente la partición oficial.

Empezar por un límite exacto de datos

El pipeline expone un contrato exacto de 11 características. fnlwgt, la variable objetivo, el marcador de la partición de origen y los campos protegidos usados para auditar no entran al modelo. Sexo y raza binaria siguen disponibles para la ruta de evaluación, lo que permite medir disparidades sin filtrar esos campos a la predicción.

La preparación comienza con una auditoría de los datos brutos. El tratamiento de valores ausentes, las identidades duplicadas, los vectores repetidos, las etiquetas conflictivas y el solapamiento entre particiones se registran en un informe de calidad. Una huella criptográfica liga ese informe con la tabla preparada para el modelo, de modo que el reporte no pueda describir silenciosamente un conjunto distinto al usado por la ejecución.

La partición oficial de prueba definida por la fuente permanece intacta. La partición de entrenamiento de origen se divide entre ajuste y validación, y cada conjunto tiene una sola responsabilidad:

Partición Responsabilidad
Entrenamiento Ajustar el preprocesamiento y el modelo de puntuación seleccionado
Validación Buscar umbrales, elegir la banda de revisión y probar la sensibilidad de la política
Prueba oficial Medir una sola vez el modelo y la política ya congelados

Esta separación importa porque el par de umbrales es una política aprendida. Tratarlo como una constante inofensiva de posprocesamiento produciría el mismo problema de filtración que ajustar hiperparámetros con el conjunto de prueba.

Buscar una política, no un umbral conveniente

Una vez congelado el modelo, los puntajes de validación entran en una búsqueda exhaustiva y bidimensional de umbrales por grupo protegido. Se evalúa cada par permitido, se eliminan las opciones dominadas y la frontera de Pareto restante expone el intercambio entre utilidad y disparidad, sin esconderlo dentro de un objetivo ajustado a mano.

La política offline elegida también incorpora una banda global de revisión alrededor de la zona de incertidumbre. La banda depende únicamente de la probabilidad del modelo, no de la pertenencia a un grupo. Así, los casos limítrofes se apartan de un resultado automático y la carga de revisión se convierte en una parte medible de la política.

La búsqueda permanece limitada a validación. El conjunto oficial de prueba recibe los umbrales y la banda de revisión ya elegidos, sin otra ronda de optimización.

Formular dos preguntas distintas sobre el solapamiento

Las identidades exactas de características pueden repetirse entre particiones de un benchmark tabular. El sistema trata ese hecho como evidencia que debe investigarse, no como una razón para reescribir silenciosamente la partición oficial.

Primero, una sensibilidad de validación sin solapamiento elimina las identidades de validación que ya aparecen en entrenamiento y vuelve a ejecutar la selección. Esta prueba pregunta si la política elegida depende de identidades repetidas durante el ajuste.

Segundo, la sensibilidad sobre los datos reservados mantiene fijos el modelo y la política, y luego separa los registros de prueba entre identidades solapadas y nuevas. Esta prueba pregunta si la evaluación cambia al considerar únicamente identidades no vistas. Como no se reajustan ni las predicciones ni la política, el análisis sigue siendo diagnóstico y no se convierte en una segunda optimización sobre prueba.

Incorporar la incertidumbre a la evidencia

El informe va más allá de las métricas agregadas por sexo. Incluye intersecciones de sexo y raza, vistas ponderadas y sin ponderar, diagnósticos de calibración, comparaciones bootstrap pareadas e intervalos de incertidumbre para medidas de utilidad y disparidad.

Cada subgrupo recibe un estado de evidencia basado en su soporte efectivo. Las celdas escasas se marcan como insuficientes en vez de convertirse en estimaciones puntuales con apariencia de certeza. Los peores rangos observados se mantienen visibles, lo que evita que un agregado favorable borre una intersección más pequeña con un comportamiento más débil.

La estabilidad entre semillas repetidas forma parte de la implementación. El ejecutor del estudio usa la misma configuración resuelta para cada semilla, comprueba que los umbrales de gobernanza y la política sean comparables, y resume la distribución de decisiones y diagnósticos. Las ejecuciones incompatibles se rechazan en lugar de promediarse.

Separar la política de auditoría del límite del servicio

La política offline puede usar umbrales por grupo protegido porque su función es estudiar una intervención de equidad. La simulación del servicio tiene otro contrato: los atributos protegidos no existen en el esquema de solicitud y tampoco se reconstruyen dentro de la API.

Límite Entradas Comportamiento de decisión
Auditoría offline Predictores y campos protegidos conservados fuera del modelo Aplica los umbrales congelados por grupo y la banda compartida de revisión para evaluar
Simulación FastAPI Exactamente las 11 características predictoras declaradas Aplica la política de servicio persistida sin atributos protegidos y devuelve auto_negative, manual_review_required o auto_positive

La API rechaza campos adicionales o ausentes, números fuera de dominio y categorías desconocidas. Antes de responder, comprueba el vocabulario del preprocesamiento ajustado contra el manifiesto y rechaza cualquier discrepancia de integridad. La ruta normal de carga también rechaza un paquete cuyo resultado de gobernanza no haya sido aceptado.

Este límite es deliberado. Una intervención offline de equidad no puede convertirse en el comportamiento del servicio solo porque ambos artefactos estén en el mismo directorio.

Permitir que la gobernanza rechace el resultado

La política de aceptación se guarda junto con el informe. Evalúa utilidad, disparidad, incertidumbre, suficiencia de evidencia y si la validación encontró una política candidata factible. Sus umbrales forman parte del registro, por lo que volver a ejecutar la regla utiliza el mismo contrato y no los valores predeterminados que existan más adelante.

Las cinco ejecuciones de referencia fueron rechazadas por la regla de gobernanza configurada. Es una respuesta informativa del sistema: una mejora en una medida no puede ocultar una infracción en otra, y una frontera sin candidatos factibles no puede regresar a una política base que parezca aprobar. El veredicto acompaña a cada paquete y controla si la ruta estándar de servicio puede cargarlo.

Vincular la implementación con su evidencia

Una auditoría completada escribe un paquete de siete archivos mediante publicación atómica:

Artefacto Función en la traza
manifest.json Liga huellas, versiones, contrato de características, identidad de datos y estado de gobernanza
model.joblib Almacena el preprocesamiento ajustado y el modelo de puntuación
policy.json Versiona la política offline de evaluación y la regla de servicio sin atributos protegidos
predictions.csv Conserva puntajes y decisiones pareadas para inspección
report.json Registra el protocolo, las métricas, la incertidumbre, las sensibilidades y el veredicto
audit.html Presenta un informe de ingeniería autocontenido y listo para imprimir
monitoring.json Captura la línea base operacional agregada

La carga falla de forma segura. Los archivos requeridos, las huellas, los esquemas, el orden de características, el vocabulario categórico, los campos de política y los vínculos del informe deben coincidir antes de que el paquete se considere utilizable.

La ruta de monitoreo trabaja con conteos agregados en lugar de registros individuales. Compara la mezcla de resultados, la presión de revisión, la distribución de puntajes, las tasas por subgrupo cuando existen y las señales de calidad de datos, y devuelve PASS, FAIL o INSUFFICIENT_EVIDENCE. Las tasas derivadas se contrastan con sus conteos para que una captura mal formada no pueda cambiar el veredicto sin ser detectada.

Qué demuestra la reconstrucción

El proyecto ahora conecta la experimentación de ML con los controles de ingeniería que vuelven revisable un flujo de decisiones importantes:

  1. La procedencia de los datos forma parte del contrato ejecutable.
  2. La optimización de la política está aislada de la medición sobre datos reservados.
  3. Los diagnósticos de equidad incluyen incertidumbre, intersecciones y sensibilidad al solapamiento.
  4. El análisis offline por grupo protegido no cruza al límite del servicio.
  5. La gobernanza puede impedir la carga de artefactos y conservar ese rechazo como evidencia.
  6. La estabilidad entre semillas y el monitoreo agregado comparten la misma traza de política.

Charles Santhakumar y yo construimos el sistema compartido original en la Universidad de Helsinki. Después diseñé e implementé esta arquitectura ampliada, el flujo de auditoría, la capa de gobernanza, el límite del servicio y este caso de estudio.

Examinar el código ligado a la evidencia →

Abrir la evidencia de cinco semillas →