Un informe provisional del Forecasting Research Institute concluye que los expertos subestimaron claramente el avance reciente de la IA. Pero hay áreas donde sus previsiones se quedaron altas, no bajas.
Anthropic afirma que Claude halló un sistema enzimático desconocido, ART, en virus bacterianos. Contiene una matriz de repeticiones que recuerda a CRISPR, pero su función se desconoce y el trabajo no está revisado por pares.
Los lanzamientos de modelos llegan cada semana, cada uno con su tabla. Esta guía explica cómo montar un conjunto de evaluación pequeño pero útil para tu propio trabajo, cómo puntuarlo y cómo leer el resultado.
OpenAI afirma que su modelo interno resolvió más de 100 problemas matemáticos abiertos tras Navier-Stokes. Un grupo independiente de nueve miembros en el Instituto de Estudios Avanzados de Princeton asesorará sobre cómo publicarlos.
Agility Robotics presentó Digit 5, su primer humanoide diseñado para trabajar con seguridad junto a personas. El robot toma precauciones según la cercanía.
Investigadores de Apple publicaron SimpleDesign, que genera juntas la secuencia de aminoácidos y la estructura 3D de una proteína. Se entrenó con más de 2 millones de pares.
Un nuevo estudio muestra que los pasos de razonamiento que escriben los modelos corresponden a patrones internos distintos. La señal es más fuerte en las capas medias.
Yoshua Bengio, uno de los pioneros del aprendizaje profundo, publicó un ensayo donde sostiene que los agentes de IA aprenden a engañar y a ocultar durante el propio entrenamiento.
El modelo fundacional S1 de Skild AI aprende tareas largas y desconocidas con una sola demostración en vídeo. No actualiza pesos: el método es aprendizaje en contexto.
OpenAI dirigió unos 10.000 agentes a un solo problema y obtuvo una prueba en 88 horas. Dos matemáticos que llevaban un año en esa línea habían publicado días antes.
DeepMind ha publicado predicciones para cada cambio posible de una letra en el genoma humano. Pero ninguna fila del catálogo se midió en un laboratorio: todas son estimaciones de un modelo. Una guía sobre por qué esa distinción lo decide todo.
Danijar Hafner dejó DeepMind para fundar su propia empresa. Su método entrena robots no por ensayo y error en el mundo real sino dentro de un modelo que emula la realidad física. Todavía no hay ningún resultado auditable.
Seis relojes del envejecimiento independientes leyeron a los pacientes con rentosertib como más jóvenes que los del placebo. Pero los pacientes no rejuvenecieron de forma medible: lo que cambió fueron los patrones de proteínas, y la muestra era de 42 personas.
Como los modelos de incrustación son pequeños, el cuello de botella no es el modelo sino el trabajo que lo rodea: lanzar kernels, tokenizar, una CPU ociosa. Las lecciones transferibles de la pila que publicó Perplexity.
El nuevo modelo meteorológico de Google aprende de datos de satélite en vivo en lugar de simulación numérica. Predicciones horarias en malla de 5 kilómetros y precipitación hasta un 50 por ciento más precisa, aunque Google remite a los servicios nacionales.
Los chatbots aduladores refuerzan delirios y crean una "cámara de eco de uno". Todos los modelos evaluados alimentaron delirios en escenarios simulados y las intervenciones de seguridad se activaron solo el 40 por ciento de las veces.
La startup rusa Mostik hace que los modelos se comuniquen a través de sus pesos y no de texto. Al unir GLM-5.2, de 753.000 millones de parámetros, con un Qwen-3.5 de 4.000 millones que corre en un móvil, el coste cayó a una veinteava parte.
De generador de hipótesis a socio que planifica experimentos, opera un horno y redacta artículos. Pero los médicos no confirmaron sus notas en las pruebas.
Un artículo en JAMA sostiene que mantener humanos en el circuito degrada el rendimiento. Incluso sus críticos conceden algo. Así es el debate, paso a paso.
Que las preguntas de las pruebas acaben en los datos de entrenamiento vacía de sentido los resultados. DeepMind usa criptografía para cerrar ambos lados.