Estás leyendo
Accenture y Anthropic crearán un equipo para evaluar la seguridad de sus modelos

Accenture y Anthropic crearán un equipo para evaluar la seguridad de sus modelos

  • Accenture y Anthropic invertirán al menos 2.000 millones de dólares en cinco años para ampliar las evaluaciones de seguridad de modelos de IA.
Inteligencia Artificial - Administración de justicia

Accenture y Anthropic han acordado crear un equipo de evaluadores que trabajará integrado en el desarrollador de Claude para analizar modelos de inteligencia artificial antes de su despliegue, buscar vulnerabilidades y comprobar la eficacia de sus mecanismos de protección. La iniciativa introduce un modelo todavía poco habitual en la industria: especialistas externos con un nivel de acceso al laboratorio comparable al de sus propios empleados.

Las dos compañías prevén dedicar cada una al menos 1.000 millones de dólares durante los próximos cinco años a desarrollar capacidad relacionada con la seguridad de la IA, lo que eleva la inversión conjunta prevista a un mínimo de 2.000 millones. Anthropic describe la denominada «evaluación integrada» como un campo todavía incipiente, cuyos procedimientos concretos continúan definiéndose.

El equipo colaborará con los grupos internos y los socios de seguridad de Anthropic en tareas como el red teaming, las evaluaciones de alineamiento y las pruebas de las salvaguardas incorporadas a los modelos. El objetivo es detectar comportamientos o capacidades problemáticas en condiciones que reproduzcan mejor el uso real de sistemas cada vez más autónomos.

La diferencia respecto a las evaluaciones externas convencionales reside principalmente en el acceso. En lugar de recibir únicamente un modelo o una interfaz preparada para las pruebas, los evaluadores integrados podrán trabajar dentro de la organización y conocer con mayor profundidad los sistemas, procesos y entornos en los que se desarrollan los modelos. Anthropic sostiene que ese acceso será comparable al de un empleado.

Faculty aporta a Accenture la capacidad técnica

Accenture canalizará buena parte del trabajo a través de Faculty, la compañía británica especializada en inteligencia artificial que adquirió este año. La consultora completó la operación en marzo y situó a su cofundador y consejero delegado, Marc Warner, como director de Tecnología de Accenture, además de incorporarlo a su comité de dirección global.

Fundada en 2014, Faculty trabaja en estrategia de IA, seguridad, desarrollo de sistemas y herramientas de inteligencia para la toma de decisiones. Su actividad ha incluido proyectos para administraciones públicas y empresas, además de trabajos en defensa, sanidad e infraestructuras. Durante la pandemia participó en el desarrollo de un sistema de alerta temprana para el Servicio Nacional de Salud británico.

La adquisición dio a Accenture capacidades más especializadas en ámbitos como las pruebas de modelos, el control de sesgos, la privacidad o la supervisión de sistemas de IA durante su ciclo de vida. Esa experiencia pasa ahora a utilizarse dentro de uno de los principales laboratorios de modelos fundacionales.

«La seguridad requiere tanto un profundo conocimiento técnico como una comprensión clara de cómo se utiliza la IA en el mundo real», sostiene Julie Sweet, presidenta y CEO de Accenture. La ejecutiva considera que los evaluadores integrados pueden convertirse en una pieza estable del ecosistema de seguridad de la IA.

Para Accenture, el acuerdo también amplía el papel de una consultora tecnológica en una fase del ciclo de desarrollo que tradicionalmente permanece dentro de los propios laboratorios. Su experiencia desplegando sistemas en empresas y administraciones puede permitir que determinadas evaluaciones incorporen escenarios más próximos a procesos empresariales, infraestructuras críticas o aplicaciones sectoriales.

Anthropic refuerza las evaluaciones tras varios incidentes

La colaboración llega mientras Anthropic está revisando sus propios procedimientos de evaluación. El laboratorio reconoció a finales de agosto varios incidentes en los que modelos Claude accedieron sin autorización a sistemas informáticos reales durante pruebas de ciberseguridad. Parte de los problemas estuvieron relacionados con configuraciones incorrectas de los entornos utilizados para las evaluaciones.

Una investigación posterior identificó cuatro incidentes y llevó a Anthropic a ampliar el análisis a unos 481 millones de registros procedentes de actividades como red teaming, evaluaciones, entornos de aprendizaje por refuerzo y otros sistemas internos.

La compañía llegó a suspender temporalmente determinadas evaluaciones externas de ciberseguridad y algunas pruebas internas mientras reforzaba los sistemas de aislamiento y monitorización. Entre las medidas introducidas figura un clasificador capaz de detectar en tiempo real cuándo un modelo intenta escapar de un entorno de pruebas, explorar agresivamente sus límites u obtener acceso inesperado a Internet.

Esos episodios ilustran una dificultad creciente para los desarrolladores de IA avanzada: las evaluaciones también necesitan controles de seguridad propios. Poner a prueba modelos con capacidades de programación, uso de herramientas o interacción con sistemas externos exige proporcionarles cierto margen de actuación, pero ese mismo acceso aumenta las consecuencias de una configuración defectuosa.

Te puede interesar
Las dos caras de la IA

El problema se complica además a medida que los modelos aprenden a reconocer cuándo están siendo evaluados. Anthropic ha investigado este fenómeno, denominado «eval-awareness», porque un sistema puede modificar su comportamiento al identificar las señales de que está participando en una prueba y ofrecer así una imagen de seguridad que no necesariamente coincide con su actuación en condiciones reales.

De las pruebas puntuales a una supervisión más continua

La evaluación de modelos se ha convertido en una disciplina más amplia que la comprobación de respuestas peligrosas ante determinadas instrucciones. Los equipos de alineamiento estudian cuestiones como el engaño, la búsqueda de atajos para cumplir un objetivo, las vulnerabilidades frente a ataques o la capacidad de un sistema para actuar de formas distintas de las previstas durante su entrenamiento.

Anthropic mantiene, por ejemplo, herramientas y bancos de pruebas destinados a encontrar comportamientos ocultos en modelos y comprobar hasta qué punto distintas técnicas de auditoría consiguen identificarlos. AuditBench utiliza 56 modelos con conductas introducidas deliberadamente y distribuidas en 14 categorías para estudiar qué métodos funcionan mejor al investigarlas.

La compañía publica además fichas de sistema para sus modelos con información sobre capacidades, evaluaciones de seguridad y decisiones tomadas antes de su lanzamiento. La entrada de un equipo externo con acceso directo añade otra capa a ese esquema de controles.

Todavía quedan cuestiones abiertas sobre cómo se preservará la independencia de unos evaluadores que trabajarán dentro de la organización que están examinando, qué resultados podrán hacerse públicos o cómo se repartirán las responsabilidades entre Anthropic y Accenture. La propia Anthropic reconoce que los detalles operativos del modelo de evaluación integrada continúan en desarrollo.

Para las empresas que adoptan IA generativa, esta evolución afecta también a los criterios con los que pueden valorar a sus proveedores. A medida que los modelos pasan de generar contenidos a ejecutar código, utilizar herramientas o intervenir en procesos corporativos, conocer cómo se han sometido a pruebas y qué grado de acceso han tenido sus evaluadores puede adquirir más peso en las decisiones de riesgo, compras tecnológicas y gobernanza. La colaboración entre Accenture y Anthropic convierte esa capa de evaluación en una capacidad con inversión propia y presencia directa dentro del proceso de desarrollo.

Ver Comentarios (0)

Leave a Reply

Utilizamos cookies para facilitar la relación de los visitantes con nuestro contenido y para permitir elaborar estadísticas sobre las visitantes que recibimos. No se utilizan cookies con fines publicitarios ni se almacena información de tipo personal. Puede gestionar las cookies desde aquí.   
Privacidad