Cómo evaluar a su proveedor de IA en 30 minutos (y por qué no es suficiente)
Por Alex Blumentals -- TwinLadder
He pasado años dentro de organizaciones de compras observando cómo se repite la misma asimetría de conocimiento. El vendedor se centra en un producto, una categoría. Elabora narrativas sofisticadas, crea una aparente diversidad y conoce sus datos a la perfección. El comprador tiene que adquirir miles de cosas en cientos de categorías y no dispone de la especialización necesaria para ver más allá de todo el material comercial.
La evaluación de proveedores de IA es esta asimetría en su forma más peligrosa. Su proveedor cuenta con un equipo de cumplimiento dedicado que produce informes de transparencia impecables. Usted tiene un analista de compras, un DPD y un asesor jurídico, ninguno de los cuales ha evaluado un sistema de IA conforme al Reglamento Europeo de Inteligencia Artificial. El Artículo 26 le exige verificar el cumplimiento de su proveedor. El Artículo 27 puede requerirle una Evaluación de Impacto en los Derechos Fundamentales. La fecha límite es el 2 de agosto de 2026.
Así que esto es lo que vamos a hacer. Vamos a darle todo lo que necesita para hacerlo usted mismo.
Los prompts
A continuación encontrará seis prompts que puede utilizar con cualquier modelo de lenguaje grande: Claude, GPT, Gemini, Llama, el que prefiera. Suba la documentación de su proveedor (informe de transparencia, ficha del modelo, condiciones de servicio, acuerdo de tratamiento de datos) y ejecute estos prompts. Cada uno se corresponde con un pilar del Estándar TwinLadder y una obligación del implementador conforme al Artículo 26.
Prompt 1: Concienciación y transparencia
"Soy un implementador de este sistema de IA conforme al Reglamento Europeo de Inteligencia Artificial. Analice la documentación de este proveedor y responda: (1) ¿Explica el proveedor con claridad qué hace el sistema de IA, qué datos utiliza y qué resultados produce? (2) ¿Explica la documentación qué clasificación de riesgo del Reglamento de IA de la UE se aplica y por qué? (3) ¿Explica qué información y documentación proporciona el proveedor para ayudarme a cumplir mis obligaciones como implementador conforme al Artículo 26? Señale cualquier lenguaje vago, información faltante o afirmaciones que no estén respaldadas por evidencia."
Prompt 2: Protección de datos y política
"Analice la documentación de tratamiento de datos de este proveedor. Responda: (1) ¿Qué datos personales procesa el sistema, con qué fines y bajo qué base jurídica? (2) ¿Utiliza el proveedor los datos del cliente para el entrenamiento o ajuste fino del modelo, y puedo excluirme? (3) ¿Dónde se almacenan y procesan los datos, y existen transferencias transfronterizas? (4) ¿Cuáles son las políticas de conservación y supresión de datos? (5) ¿Ha realizado el proveedor una EIPD para este sistema? Si no, ¿por qué? Señale cualquier laguna respecto a los Artículos 13-14 del RGPD (transparencia) y los Artículos 35-36 (EIPD)."
Prompt 3: Formación y apoyo en competencias
"Analice qué formación y soporte proporciona este proveedor. Responda: (1) ¿Qué materiales formativos existen para el personal que utilizará o supervisará este sistema? (2) ¿Existe formación específica por rol para las distintas partes interesadas (usuarios finales, administradores, responsables de cumplimiento)? (3) ¿Cubre la formación las limitaciones del sistema y los modos de fallo, no solo las funcionalidades? (4) ¿Cómo evalúa el proveedor si el personal del implementador es competente para utilizar el sistema? Señale cualquier formación que parezca un tutorial del producto en lugar de desarrollo de competencias."
Prompt 4: Herramientas y supervisión humana
"Analice las capacidades de supervisión humana documentadas para este sistema de IA. Responda: (1) ¿Qué herramientas proporciona el proveedor para monitorizar las decisiones y resultados de la IA? (2) ¿Qué capacidades de registro y trazabilidad existen? (3) ¿Puede el implementador pausar, anular o apagar el sistema? (4) ¿Qué herramientas de detección de sesgos y supervisión de equidad se incluyen? (5) ¿Qué monitorización de rendimiento rastrea la precisión, fiabilidad y desviación a lo largo del tiempo? Compare todo esto con los requisitos del Artículo 14 (supervisión humana)."
Prompt 5: Evidencia y documentación
"Analice la documentación probatoria que proporciona este proveedor. Responda: (1) ¿Existe una ficha del modelo o documentación técnica equivalente que cubra los datos de entrenamiento, la arquitectura y las limitaciones conocidas? (2) ¿Qué certificaciones, estándares o auditorías de terceros ha superado el sistema? (3) ¿Qué evidencia de pruebas y validación existe sobre precisión, equidad y robustez? (4) ¿Qué procedimientos de respuesta ante incidentes están documentados? (5) ¿Qué procesos de control de versiones y gestión de cambios existen para las actualizaciones del modelo? Evalúe la documentación conforme a los requisitos del Artículo 11 (documentación técnica) y el Artículo 13 (transparencia)."
Prompt 6: Gobernanza y rendición de cuentas
"Analice el marco de gobernanza de este proveedor. Responda: (1) ¿Quién tiene la responsabilidad última sobre la seguridad del sistema de IA? (2) ¿Qué procesos de gestión de riesgos existen para todo el ciclo de vida de la IA? (3) ¿Existen procesos de revisión ética, líneas rojas o restricciones de uso? (4) ¿Qué compromisos contractuales existen en torno al rendimiento, la precisión y el cumplimiento: ANS o garantías? (5) ¿Cómo gestiona el proveedor las solicitudes de auditoría y las evaluaciones de diligencia debida? (6) ¿Cuál es el enfoque respecto a la responsabilidad e indemnización por los resultados de la IA? Señale cualquier laguna de gobernanza respecto a los requisitos del Artículo 9 (gestión de riesgos)."
La puntuación
Después de ejecutar estos prompts, puntúe cada pilar en una escala de 0 a 3:
- 0 -- Sin evidencia. El proveedor no aporta nada que aborde esta área.
- 1 -- Parcial. Existe cierta información pero es vaga, incompleta o no específica del sistema de IA.
- 2 -- Adecuado. Documentación clara y específica que aborda los requisitos fundamentales.
- 3 -- Exhaustivo. Documentación detallada, respaldada por evidencia, con compromisos proactivos.
Calcule el porcentaje: puntuación total sobre 18, multiplicada por 100. Asígnelo a los niveles del Estándar TwinLadder:
| Puntuación | Nivel | Qué significa |
|---|---|---|
| 0--25% | Explorando | Riesgo significativo de incumplimiento. No proceda sin un plan de remediación del proveedor. |
| 26--50% | Desarrollando | Lagunas materiales. Aceptable solo para despliegues de riesgo mínimo con controles adicionales. |
| 51--75% | Implementando | Buena postura de cumplimiento. Despliegue con medidas de supervisión documentadas. |
| 76--100% | Optimizando | Postura de cumplimiento sólida. Evidencia de gobernanza proactiva. |
Las plantillas
Para una evaluación más estructurada, proporcionamos tres plantillas RFI completas, de 36 a 48 preguntas cada una, con criterios de puntuación y orientación para cada pregunta:
- RFI General de Proveedores de IA -- 36 preguntas en 7 pilares. Funciona para cualquier proveedor de IA.
- RFI de Proveedores de IA de Alto Riesgo -- 48 preguntas, incluyendo 12 específicas para sistemas de alto riesgo del Anexo III y preparación de la EIDF.
- RFI de Herramientas de IA para RRHH -- 48 preguntas, incluyendo 12 específicas para IA en empleo y reclutamiento conforme a la Categoría 4 del Anexo III.
Cada pregunta está vinculada a una obligación específica del implementador conforme al Artículo 26 y puntuada según los pilares del Estándar TwinLadder. Cada pregunta incluye orientación sobre cómo son las respuestas buenas, adecuadas y deficientes.
Estas plantillas son gratuitas. Regístrese en una cuenta TwinLadder y descárguelas inmediatamente. Sin periodo de prueba. Sin conversación comercial. Son suyas.
Y ahora, por qué no es suficiente
Sería deshonesto si me detuviera aquí. Los prompts funcionan. Las plantillas son exhaustivas. Si los ejecuta con diligencia, sabrá más sobre la postura de cumplimiento de su proveedor de IA que el 90% de las empresas europeas de tamaño medio hoy en día.
Pero hay cinco cosas que ningún prompt, ninguna plantilla y ningún LLM pueden ofrecerle, independientemente de lo bueno que sea el modelo.
1. Evaluación contextualizada
Un LLM analiza el documento que usted le proporciona. No conoce su organización. No sabe que está implementando esta herramienta de selección de RRHH en Letonia, donde la intersección del Artículo 26 del Reglamento de IA de la UE y la legislación laboral letona crea obligaciones específicas que difieren de implementar la misma herramienta en Alemania o Francia. No sabe que su equipo de RRHH tiene tres personas y ningún rol dedicado a la supervisión de IA, lo que cambia el significado práctico de "supervisión humana adecuada".
La misma documentación del proveedor produce un veredicto de cumplimiento diferente según quién implementa, dónde, para qué caso de uso y con qué capacidades internas. Un LLM trata el documento como contextualmente completo. No lo es.
2. Calibración de competencias
La puntuación de madurez TwinLadder de su organización determina qué medidas de supervisión necesita realmente. Un equipo de Nivel 1 (Explorando) que implementa una herramienta de IA de alto riesgo necesita controles fundamentalmente diferentes que un equipo de Nivel 3 (Implementando) que implementa la misma herramienta. La documentación del proveedor puede ser adecuada para uno e insuficiente para el otro.
Este es el principio del Artículo 4 en acción. La alfabetización en IA no es una casilla que marcar: es una capacidad que determina lo que significa "uso apropiado". Un LLM no puede calibrar los requisitos del proveedor frente al nivel real de competencia de su personal porque no conoce a su personal.
3. Benchmarks comparativos
Cuando le decimos que un proveedor ha obtenido el percentil 35 en documentación formativa, esa cifra tiene significado. Significa que hemos evaluado suficientes proveedores para construir una distribución. Significa que sabemos cómo es la excelencia, no en teoría, sino a partir de datos de cientos de evaluaciones.
Un LLM no tiene benchmark. Puede decirle que la documentación "parece exhaustiva" o "tiene lagunas". No puede decirle si esas lagunas son típicas del sector o catastróficamente por debajo del estándar. Sin datos comparativos, cada evaluación es una isla.
4. Solidez jurídica
Si un regulador le pide que demuestre la diligencia debida conforme al Artículo 26, ¿qué le mostrará? ¿Una conversación con un LLM? ¿Una transcripción de chat guardada?
Un Informe de Cumplimiento de Proveedores TwinLadder es un documento estructurado vinculado a obligaciones específicas del implementador conforme al Artículo 26(1), puntuado según una metodología abierta y auditable (el Estándar TwinLadder, CC BY-SA 4.0), y --para el nivel Pro-- revisado y validado por un evaluador cualificado. Está diseñado para ser evidencia. Una conversación con un LLM no lo es.
5. El puente hacia la EIDF
Si su sistema de IA es de alto riesgo conforme al Anexo III, el Artículo 27 exige una Evaluación de Impacto en los Derechos Fundamentales antes del despliegue. Esto no es opcional para organismos públicos, proveedores de servicios públicos u organizaciones que utilicen IA para la calificación crediticia o los seguros.
Una EIDF no es un documento que se pueda generar a partir de un prompt. Requiere identificar a las personas afectadas, mapear las implicaciones de la Carta de los Derechos Fundamentales, realizar un análisis de riesgos estructurado con puntuación de probabilidad y gravedad, planificar medidas de mitigación y documentar mecanismos de supervisión. Los datos de la evaluación del proveedor alimentan directamente la EIDF, pero solo si la evaluación se estructuró para captar los datos correctos.
Nuestro flujo de trabajo de EIDF toma los datos de evaluación del proveedor que usted ya produjo y precumplimenta el 30--40% de los requisitos de la EIDF. Ningún prompt puede hacer esto porque la conexión entre la evaluación del proveedor y la EIDF es arquitectónica, no textual.
La propuesta honesta
Esto es lo que ofrecemos, y por qué.
Nivel gratuito (usuarios registrados):
- Seis prompts (arriba) -- úselos con cualquier LLM
- Tres plantillas RFI (36--48 preguntas cada una) con criterios de puntuación
- Verificador de elegibilidad para la EIDF -- seis preguntas para determinar si necesita una Evaluación de Impacto en los Derechos Fundamentales
Los ofrecemos gratuitamente porque la metodología debe ser accesible. El Estándar TwinLadder es abierto (CC BY-SA 4.0). Creemos que el marco debe ser un bien público. Si puede hacerlo usted mismo, hágalo.
Nivel de pago (cuando necesite más):
- Informe de Cumplimiento del Artículo 26 (desde 490 €) -- evaluamos al proveedor, producimos el informe, lo vinculamos a sus obligaciones específicas
- Evaluación de Impacto del Artículo 27 (desde 1.500 €) -- flujo de trabajo guiado de EIDF en 7 pasos, precumplimentado con los datos de la evaluación
- Kit de Cumplimiento del Implementador (desde 2.500 €) -- ambos en un flujo de trabajo integrado
- Kit de Cumplimiento del Implementador Pro (desde 5.000 €) -- con revisión de un evaluador experto y validación jurídica
El nivel de pago existe porque el contexto, la calibración, los benchmarks, la solidez jurídica y la integración con la EIDF son cosas que requieren una plataforma, no un prompt. No estamos ocultando la metodología. Estamos ofreciendo aplicarla, con el contexto específico de su organización, frente a nuestros datos de benchmark acumulados, produciendo documentos que resisten el escrutinio regulatorio.
Qué hacer ahora mismo
- Realice la verificación gratuita de elegibilidad para la EIDF. Dos minutos. Sepa si el Artículo 27 le aplica.
- Regístrese y descargue las plantillas RFI. Ejecútelas contra su proveedor de IA más crítico.
- Utilice los prompts de arriba con la documentación de su proveedor. Puntúelo. Vea dónde están las lagunas.
- Si necesita más -- evaluación contextualizada, benchmarks comparativos, evidencia jurídica, documentación de la EIDF -- inicie una evaluación de proveedor.
La fecha límite es el 2 de agosto de 2026. Sus proveedores tienen documentación. La cuestión no es si puede leerla. La cuestión es si puede evaluarla, para su personal, sus flujos de trabajo, su posición regulatoria.
Esa es la brecha que un LLM no puede cerrar.
Fuentes
-
Reglamento (UE) 2024/1689, Artículo 26 -- Obligaciones de los implementadores de sistemas de IA de alto riesgo, incluyendo la verificación del cumplimiento del proveedor, la supervisión humana y los requisitos de documentación. EUR-Lex
-
Reglamento (UE) 2024/1689, Artículo 27 -- Evaluación de impacto en los derechos fundamentales para sistemas de IA de alto riesgo implementados por organismos públicos, proveedores de servicios públicos y para la calificación crediticia o de seguros. EUR-Lex
-
Reglamento (UE) 2024/1689, Artículo 4 -- Obligación de alfabetización en IA que exige a proveedores e implementadores garantizar una alfabetización suficiente del personal en materia de IA. EUR-Lex
-
Estándar TwinLadder v1.1 -- Metodología abierta (CC BY-SA 4.0) para evaluar la competencia organizacional en IA a través de siete pilares. Estándar TwinLadder
-
Carta de los Derechos Fundamentales de la UE -- Artículos 1, 7, 8, 21, 31, 41, 47 -- referenciados en los requisitos de la EIDF del Artículo 27 para el mapeo de derechos. EUR-Lex
