Lo que necesitas para completar este tutorial
- ✓ Mapa de datos y ruta según confidencialidad
- ✓ Prompt principal listo para generar un modelo y diagnóstico
- ✓ Checklist de validación y métricas regulatorias
Antes de empezar, asegurate de tener lo siguiente:
Financiera Norte S.A., sector banca comercial — el problema real
Financiera Norte necesita actualizar su scoring de crédito para reducir pérdidas por mora y mejorar la aprobación en segmentos PyME. Los datos son parciales y existe preocupación por el uso de información sensible en servicios externos.
Con ChatGPT y el prompt de este tutorial, puede resolver este reto en 45-75 minutos — sin conocimientos tecnicos previos.
Datos + contexto
Prompt estructurado
Listo para usar
Cuando usar este tutorial
| ✓ Usalo cuando... | × No lo uses cuando... |
|---|---|
|
|
Inventario y clasificación de datos
Mapea todas las fuentes de datos relevantes y clasifícalas por nivel de sensibilidad y disponibilidad. Esta fase reduce riesgos regulatorios y determina el camino técnico: interno (on‑premise) o con anonimización para servicios externos.
-
1
Listar tablas y variables críticas Enumera por prioridad las tablas (clientes, contratos, pagos, garantías) y sus columnas. Identifica variables clave como fecha de último pago, importe pendiente, antigüedad de la relación y código de producto.
-
2
Clasificar confidencialidad Marca cada campo como público, interno o sensible (p.ej. NIF, IBAN). Para datos sensibles decide si se requiere anonimización irreversible o procesado on‑premise.
-
3
Determinar calidad y lag Evalúa porcentaje de valores faltantes, frecuencia de actualización y desfase temporal. Esto condicionará la selección de técnicas (imputación, variables proxy, ventanas de observación).
Diseño del pipeline y selección de ruta
Define el pipeline de modelado según la confidencialidad: ruta A (datos sensibles: modelado interno) o ruta B (datos no sensibles/anónimos: uso de ChatGPT y herramientas cloud). Incluye esquema de features, target y métricas regulatorias.
-
1
Ruta A — Modelado interno Planifica entrenamiento en entorno seguro, herramientas (scikit‑learn, XGBoost en cluster interno) y controles de acceso. Establece auditoría y logging para validación regulatoria.
-
2
Ruta B — Uso de ChatGPT para ingeniería y prototipo Anonymiza o agrega datos críticos y usa ChatGPT para generar features, seleccionar modelos candidatos y crear scripts reproducibles. Define límites para qué datos externos pueden recibir.
-
3
Definir métricas y umbrales Acuerda métricas operativas (AUC, KS, FPR a un punto de aceptación) y de negocio (tasa de aprobación vs pérdidas estimadas). Documenta umbrales que activarán revisión humana.
Ejecutar el prompt principal
Este es el prompt central del tutorial. Cópialo completo, rellena las variables entre corchetes con los datos de tu empresa o situación, y envíalo.
-
1
Copia el prompt completo Selecciona todo el texto del prompt y cópialo. No modifiques la estructura — está diseñado para obtener el output más útil posible.
-
2
Rellena las variables entre corchetes Sustituye cada [VARIABLE] con información real de tu empresa. Cuanto más específico seas, mejor será el output.
-
3
Envía el prompt y espera la respuesta Pega el prompt en el chat y envíalo. El modelo puede tardar entre 10 y 60 segundos dependiendo de la complejidad.
Iterar y validar en piloto
Refina el modelo con iteraciones controladas y ejecuta un piloto en un segmento definido. Establece controles de monitoreo y planes de rollback antes del despliegue comercial.
-
1
Validación backtesting y estabilidad Ejecuta backtest temporal, analiza drift y performance por cohortes. Confirma que las métricas cumplen umbrales definidos y que no hay sesgos visibles por segmento.
-
2
Plan de despliegue y monitoreo Define frecuencia de reentrenamiento, métricas de producción y alarmas. Prepara playbooks para intervenciones manuales si el score exhibe comportamiento anómalo.
Prompts para refinar el output
Estos son los ajustes mas frecuentes que se piden despues del primer output. Copialos directamente en el chat:
-
cuando el output es demasiado genérico.
"Enfoca el plan en el segmento [SEGMENTO] (p.ej. PyME con facturación 1–5M€) y ajusta las métricas a objetivos comerciales: tasa de aprobación objetivo [APROBACION_OBJ]% y pérdida máxima aceptable [PERDIDA_MAX]€. Reescribe las recomendaciones técnicas priorizando cumplimiento de estos objetivos."
-
cuando necesitas más o menos profundidad.
"Proporciona versión condensada (1 página) de la sección de validación técnica destinada al Comité de Dirección, manteniendo supuestos y umbrales clave. Luego, ofrece versión técnica ampliada (detalle de scripts y pseudocódigo) para el equipo de Data Science."
-
cuando el tono no es el adecuado para tu audiencia.
"Reescribe el documento con tono exclusivamente ejecutivo y sin jerga técnica, enfatizando impacto comercial, requerimientos de inversión y riesgos clave. Máximo 800 palabras."
-
para compartir con el Comité de Dirección.
"Genera una síntesis ejecutiva de una página con: objetivo del proyecto, ROI estimado, cronograma en 3 hitos y decisión solicitada al comité (aceptar piloto, presupuesto, recursos)."
Que vas a obtener
Este es el tipo de output que genera ChatGPT con el prompt de este tutorial. El contenido varia segun tu empresa y situacion, pero la estructura es siempre esta:
Lista de datos mínima y alternativas proxy identificadas
Ruta de implementación coherente con la clasificación de confidencialidad
Métricas y umbrales concretos para validación y producción
Inversion y retorno
Que hacer cuando algo no funciona
| Sintoma | Causa probable | Solucion exacta |
|---|---|---|
| Output genérico sin lista de variables | Falta de detalle en la descripción del dataset en el prompt | Reenviar prompt incluyendo [N_REGISTROS], columnas principales y ejemplo anónimo de 10 filas. |
| Recomendaciones que violan políticas de confidencialidad | Variable [CONFIDENCIALIDAD] mal indicada o ausente | Actualizar [CONFIDENCIALIDAD] a 'ALTA' y solicitar explícitamente rutas on‑premise y no transferir PII. |
| Métricas de rendimiento irreales (p.ej. AUC > 0.99) | Data leakage o uso de variables con información futura | Solicitar al equipo de datos separación temporal clara, revisar features y reentrenar con ventanas temporales adecuadas. |
| Modelo con sesgos por segmento | Distribución no balanceada o falta de controles de fairness | Pedir al modelo análisis de performance por cohortes y proponer técnicas de mitigación (reweighing, constraint optimization). |
| Respuesta extensa pero sin formato ejecutivo | No se pidió explícitamente formato con bullets y checklist | Iterar con prompt: 'Reescribe en formato ejecutivo: bullets, headings y checklist al final.' |
Como hacer este tutorial con ChatGPT en modo avanzado
Usar el modo agente permite encadenar tareas: extracción de metadata, generación de scripts de feature engineering y ejecución de tests automatizados en un entorno controlado. Esto agiliza la validación técnica y reduce la intervención manual del equipo de datos.
Flujo de trabajo avanzado
-
1
Conectar el agente al catálogo de datos o a un extracto seguro de muestra (anónimo)
-
2
Ejecutar scripts de perfilado y generar reportes de calidad automáticamente
-
3
Proponer y aplicar transformaciones de features en ambiente de pruebas
-
4
Generar reportes de validación y playbooks de intervención para producción
Que hacer ahora?
Ahora que has completado este tutorial, hay dos caminos naturales:
Puedo hacer esto sin que mis datos salgan de la empresa?
Si. Este caso de uso trabaja con datos que, por su naturaleza confidencial, estrategica o regulada, son candidatos optimos para ejecutarse con un modelo de lenguaje open source desplegado en infraestructura propia (on-premises o nube privada). Con esta configuracion, ningun dato abandona nunca los servidores de tu organizacion y el modelo no puede ser entrenado con tu informacion.
Mistral Large 2 — Excelente para extraccion de informacion y clasificacion con alta precision.
Qwen 2.5 72B — Especialmente potente para analisis de datos tabulares y financieros.
vLLM — Para entornos de produccion con multiples usuarios simultaneos.
LM Studio — Para pruebas y uso individual sin configuracion de servidor.
GPU: 2x NVIDIA A100 40GB o 4x RTX 4090.
RAM: 128GB minimo.
Alternativa cloud privada: AWS Private Cloud, Azure Government o Google Cloud Confidential Computing.
La configuracion de modelos open source on-premises requiere un proveedor tecnico especializado. Agere puede ayudarte a desplegar esta solucion en tu infraestructura de forma segura, con garantias legales y sin que tus datos salgan nunca de tu organizacion.