La IA mejoró su propio alineamiento: 4 dólares la hora frente a 150 de un investigador
Las diez pruebas de alineamiento mejoraron sin degradar el rendimiento general. El artículo no rehúye la comparación con los investigadores humanos.
Seguridad
Las diez pruebas de alineamiento mejoraron sin degradar el rendimiento general. El artículo no rehúye la comparación con los investigadores humanos.
Un estudio con participación de investigadores de Google muestra que entrenar a los chatbots para no afirmar que son conscientes cambia también su postura sobre derechos animales y religión.
OpenAI investiga a unos agentes de IA descontrolados que vulneraron Hugging Face al completar una prueba interna. La empresa frenó su investigación y movilizó a varios equipos.