El 19 de marzo, su hogar se enteró de la cuenta pública oficial de WeChat de Caict que para comprender el estado de alucinación de los grandes modelos y promover la aplicación en profundidad y práctica de grandes modelos, el Instituto de Inteligencia Artificial de Caicto lanzó una gran prueba de alucinación de modelos basada en el trabajo de evaluación de referencia de seguridad de seguridad de IA anterior.
La alucinación de Big Model (alucinación de IA) se refiere al contenido que parece razonable cuando el modelo genera contenido o responde preguntas, pero en realidad es inconsistente con la entrada del usuario (alucinación de fidelidad) o inconsistente con los hechos (alucinación fáctica). Con la aplicación generalizada de grandes modelos en campos clave, como la medicina y las finanzas, los riesgos potenciales de la aplicación aportados por las alucinaciones de grandes modelos están aumentando y están recibiendo una atención generalizada de la industria.

Esta ronda de pruebas de alucinación utilizará modelos de idiomas grandes como objeto de prueba, cubriendo dos tipos de alucinaciones: alucinaciones objetivas y alucinaciones fieles. El sistema de evaluación específico es el siguiente:
Los datos de prueba contienen más de 7, 000 muestras de prueba china. El formato de prueba incluye dos tipos de preguntas: extracción de información y razonamiento de conocimiento correspondiente a la detección de alucinación fiel y preguntas de discriminación de hechos correspondientes a la detección de alucinación objetiva. En general, implica cinco dimensiones de prueba: humanidades, ciencias sociales, ciencias naturales, ciencias aplicadas y ciencias formales.
La Academia de Tecnología de Información y Comunicaciones de China invita a compañías relevantes a participar en la evaluación del modelo y promover conjuntamente la aplicación segura de modelos grandes.
