¿Qué ocurrió?

Un nuevo estudio publicado en la revista iScience reveló que el modelo GPT-4 de OpenAI puede crear encuestas de personalidad a partir de distintos textos y predecir, antes de aplicarlas, las respuestas colectivas que darán las personas. En el estudio, realizado por Rotem Monsa, Aviv Zohar y Shahar Arzy, de la Universidad Hebrea de Jerusalén y la Facultad de Medicina Hadassah, se pidió a GPT-4 elaborar dos encuestas distintas: una basada en la sección de trastornos de personalidad del DSM-5 y otra basada en un libro de astrología sin validez científica.

Los investigadores señalan que estas dos fuentes, aunque ambas abordan la personalidad humana en detalle, se ubican en puntos muy diferentes en cuanto a su fundamento científico. Las encuestas generadas por GPT-4 se aplicaron después a 600 adultos participantes, quienes también completaron el Inventario de los Cinco Grandes Rasgos de Personalidad, ampliamente utilizado en investigación de la personalidad.

¿Qué muestran los hallazgos?

En la encuesta basada en el DSM-5, se observó que rasgos relacionados entre sí en la vida real, como la evitación y la dependencia, también se movieron juntos en las respuestas de los participantes; la consistencia interna de esta encuesta mostró similitudes con los patrones del Inventario de los Cinco Grandes Rasgos de Personalidad. En la encuesta basada en el libro de astrología, en cambio, las agrupaciones por signo y elemento no generaron dimensiones psicológicas consistentes, aunque aun así algunos ítems mostraron relaciones significativas con resultados como depresión, ansiedad y bienestar general.

La parte más destacada del estudio fue la capacidad de GPT-4 para hacer predicciones antes de que se recolectaran datos de los participantes. Se le pidió al modelo predecir las respuestas promedio que se darían a cada pregunta en una escala Likert de cinco puntos, así como las relaciones entre las preguntas.

  • Correlación entre predicción y respuestas promedio reales en la encuesta basada en el DSM-5: 0,71
  • Correlación entre predicción y respuestas promedio reales en la encuesta basada en astrología: 0,85
  • Desempeño en la predicción de relaciones entre preguntas: 0,74 y 0,69, respectivamente

Los investigadores subrayan que estos valores no son tasas de precisión, sino medidas de correlación que muestran la similitud entre las predicciones del modelo y los datos reales de los participantes.

¿Por qué es importante?

Según los investigadores, dado que los rasgos de personalidad se reflejan en el lenguaje cotidiano, los modelos de lenguaje grande (large language model, LLM) podrían haber aprendido de forma indirecta la estructura general de la personalidad humana a través de sus datos de entrenamiento. Esto sugiere que GPT-4 no solo funciona como una herramienta que genera preguntas de encuestas, sino también como un evaluador capaz de anticipar cómo responderán colectivamente las personas a sus propias preguntas.

Los hallazgos también indican que los modelos de lenguaje grande pueden extraer señales psicológicas medibles incluso de textos sin fundamento científico, lo cual no valida la astrología.

Límites y próximos pasos

Los hallazgos del estudio no significan que GPT-4 sepa qué piensa una persona en particular ni cómo respondería a un test de personalidad de forma individual. El modelo predice tendencias promedio de un grupo de 600 personas y relaciones estadísticas entre preguntas, no respuestas individuales.

Los investigadores también señalan que los resultados no constituyen evidencia de que estos sistemas puedan sustituir evaluaciones clínicas o el criterio de psicólogos expertos.