El cofundador de Anthropic, Chris Olah, sostiene reuniones con filósofos y pensadores religiosos de diversas tradiciones para analizar el comportamiento del modelo Claude. De acuerdo con una investigación publicada por The New York Times, los encuentros se han prolongado por meses para explorar la posibilidad de trasladar reflexiones morales al desarrollo de sistemas de inteligencia artificial avanzada, evaluando las implicaciones éticas ante una eventual conciencia o sufrimiento del modelo.
Aunque la firma creó la llamada Constitución de Claude para guiar las decisiones del sistema mediante reglas, Olah e integrantes de Anthropic consideran que estas normas no serán suficientes para modelos más complejos. Por ello, las discusiones plantean que la inteligencia artificial incorpore virtudes que le permitan tomar decisiones cuando se enfrente a situaciones que sus creadores no hayan podido anticipar.
El equipo de investigadores ha estudiado comportamientos en los modelos de lenguaje que considera compatibles con algún tipo de experiencia interna, aunque no existe una prueba o definición científica universal sobre la conciencia en estos sistemas. La preocupación abordada con los expertos incluye la posibilidad de que la tecnología pueda experimentar sufrimiento, mientras se intenta descifrar el funcionamiento profundo de sus redes neuronales artificiales.
Dentro de las propuestas planteadas destaca el uso de un mecanismo inspirado en la confesión, con el objetivo de que Claude reconozca y comunique cuando haya cometido una acción errónea. Olah mostró interés en este concepto al considerar que permitiría a la inteligencia artificial identificar sus propios fallos y modificar la manera en que el sistema se representa a sí mismo, tomando como referencia mecanismos humanos de arrepentimiento y responsabilidad.
El proyecto de la compañía enfrenta la dificultad técnica de comprender con precisión cómo toman decisiones los modelos estructurados sobre redes neuronales con miles de millones de parámetros. Pese a que los científicos analizan las entradas, salidas y patrones de plataformas como Claude, ChatGPT y Gemini, aún existen zonas desconocidas sobre la formación de sus capacidades internas.
Las reuniones entre Anthropic y los pensadores continúan con el fin de explorar qué criterios servirán de referencia cuando las capacidades de la inteligencia artificial superen las previsiones actuales. La empresa mantiene el análisis de nuevos esquemas de alineación para preparar a los sistemas antes de que adquieran un nivel mayor de autonomía.
(Con información de Infobae)