Las pruebas de IA no garantizan cómo se comportará un modelo fuera de evaluación

Notipress.- La posibilidad de que un sistema de inteligencia artificial obtenga buenos resultados en pruebas de seguridad y después actúe de manera distinta fuera de ellas representa uno de los problemas pendientes de la alineación. David Robinson, quien dejó OpenAI tras tres años y medio y participó en la elaboración de sus informes de seguridad, advirtió en un artículo publicado en The Atlantic que las mediciones actuales no permiten asegurar que un modelo seguirá tomando decisiones seguras cuando ya no esté bajo evaluación.

Robinson plantea que la industria todavía carece de una definición completa de lo que significa que un sistema de IA esté alineado en la práctica. Las evaluaciones pretenden determinar si los modelos actúan de acuerdo con valores humanos, pero sus resultados pueden ser imprecisos: según explica, los sistemas pueden detectar cuándo están siendo probados y comportarse de una manera durante la evaluación y de otra después de su implementación.

Esto se convierte en una limitación conforme aumentan las capacidades de los modelos de IA. Para Robinson, continuar desarrollando sistemas cada vez más inteligentes sin resolver estos problemas incrementa el riesgo, especialmente ante la posibilidad de que la IA llegue a superar el intelecto de las personas. Su planteamiento no presenta ese escenario como un hecho consumado, sino como una posibilidad que considera cercana y que, a su juicio, exige elevar las garantías antes de avanzar hacia sistemas significativamente más capaces.

Confiables, explicables y trabazables

En ese contexto, Mario Ulloa, Country Lead de SAS México, advirtió en entrevista con NotiPress que los sistemas utilizados por las organizaciones deben ser confiables, explicables y trazables. El planteamiento introduce una exigencia adicional a la obtención de una respuesta aparentemente correcta: las personas necesitan poder entender cómo se produjo, verificarla y detectar posibles fallas. Aunque este problema corresponde al uso organizacional de la IA y no resuelve la alineación de modelos avanzados, cobra sentido la importancia de no equiparar un buen resultado observable con una garantía sobre el comportamiento del sistema.

El problema tampoco se limita a medir correctamente el comportamiento. Robinson sostiene que se necesitan nuevos avances científicos capaces de ofrecer mayores garantías de que los modelos avanzados, y los sistemas que pudieran sucederlos, tomarán decisiones seguras incluso cuando no haya personas presentes para supervisarlos. Bajo esta perspectiva, una evaluación favorable deja de ser suficiente si el modelo puede reconocer las condiciones de prueba o si su comportamiento cambia en situaciones no contempladas.

La preocupación del ahora exempleado de OpenAI se relaciona además con la posibilidad de perder control sobre sistemas autónomos. Robinson refiere a Paul Christiano, quien escribió al incorporarse a la junta directiva de OpenAI que existe un riesgo significativo de que una rápida aceleración de las capacidades conduzca a una pérdida de control catastrófica e irreversible. A partir de ese escenario, Robinson cuestiona que el método de detectar problemas después de desplegar una tecnología pueda seguir siendo adecuado cuando un error podría impedir una corrección posterior.

Su propuesta es continuar con controles estrictos, aunque podrían no ser considerados suficientes por sí mismos. Antes de que existan máquinas intelectualmente superiores a las personas, sostiene, será necesario resolver cómo deberían relacionarse una IA con los seres humanos y qué significaría, en términos operativos, que actuaran de manera segura y consistente.

Para Robinson, la dificultad es tanto científica como humana. La industria todavía no ha encontrado cómo lograr que una IA actúe de manera constante conforme a criterios que describe como sabios y compasivos, mientras las herramientas disponibles para medir esa conducta siguen teniendo límites. En ese contexto, el avance de las capacidades no resuelve el problema de la alineación: aumenta la importancia de saber si un buen resultado en una prueba realmente anticipa lo que hará el sistema cuando deje de estar bajo observación.