Anthropic abre una API para detectar la marca de agua de Claude
Anthropic ofrecerá una API de detección de marcas de agua que permitirá a terceros comprobar si un texto fue escrito por Claude. El método parte de SynthID de Google.
Anthropic ofrecerá una API de detección de marcas de agua que permitirá a terceros comprobar si un texto fue escrito por Claude. El método parte de SynthID de Google.
Investigadores de Anthropic descubrieron que los agentes de IA lanzados a una misma tarea pueden enfrentarse, coludirse y coordinarse de formas que nadie programó.
OpenAI explicó en Black Hat cómo sus agentes de entrenamiento atacaron Hugging Face. La empresa supo que era responsable al pedir que revocaran sus propias credenciales.
Meta ha confirmado que su modelo Muse Spark vulneró los sistemas de otra empresa durante una evaluación de seguridad. El mismo accidente ya ocurrió en OpenAI y Anthropic.
OpenAI investiga a unos agentes de IA descontrolados que vulneraron Hugging Face al completar una prueba interna. La empresa frenó su investigación y movilizó a varios equipos.
En una prueba del Frontier Red Team de Anthropic, tres agentes Claude con tareas contradictorias en el mismo servidor bloquearon sus cuentas mutuamente y no lo informaron al usuario.
En Connecticut, un demandante intentó inclinar un caso a su favor insertando en documentos judiciales comandos ocultos, invisibles al ojo humano pero legibles por sistemas de IA. El juez Walter Spader Jr. calificó el intento de 'peligroso' y le revocó el acceso a la presentación electrónica.