Los modelos están más seguros justo cuando se equivocan, revela una evaluación
Un banco de pruebas reveló un patrón que la revisión cualitativa no veía: los modelos muestran su mayor confianza precisamente cuando sus respuestas son erróneas.
Artículos, hallazgos técnicos y resultados de laboratorio.
Un banco de pruebas reveló un patrón que la revisión cualitativa no veía: los modelos muestran su mayor confianza precisamente cuando sus respuestas son erróneas.
Investigadores de Anthropic descubrieron que los agentes de IA lanzados a una misma tarea pueden enfrentarse, coludirse y coordinarse de formas que nadie programó.
La prueba MindTopo de Microsoft Research mide si los modelos multimodales entienden relaciones como la conectividad o los nudos. Aciertan en imágenes fijas, no al actuar.
CARE-X, de Microsoft Research, combina el informe en texto libre con puntuaciones diagnósticas calibradas en radiografía de tórax. Es un modelo de investigación, no un producto.
Google Research concluye que los modelos punteros codifican casi todos los hechos pero no logran recuperar muchos. El error nace del acceso, no de la ausencia.
AMIE, el sistema médico de IA de investigación de Google, ha demostrado capacidad para consultas clínicas por vídeo en tiempo real. Los pacientes actores prefirieron el vídeo al chat de texto.
Princeton y el AI Security Institute británico dieron a agentes de IA las preguntas de investigación de dos artículos inéditos de NeurIPS. Ambos resultados fueron rechazados.
PerceptionBench, de Moonshot AI, aísla la percepción visual de los modelos multimodales del razonamiento. Ninguno de los 16 modelos punteros evaluados alcanzó el 60 por ciento de acierto.
Nolan Lovett, de la NATO Special Operations University, sostiene que las decisiones racionales de las empresas sobre IA pueden destruir la experiencia colectiva de profesiones enteras.
MarkTechPost publicó una guía completa en Colab que muestra cómo ajustar finamente un modelo de lenguaje pequeño usando el conjunto de datos de razonamiento de SupraLabs.
El investigador Sebastian Raschka compartió un proyecto educativo que enseña a construir un sistema de detección de texto de IA desde cero, inspirado en la nueva función de Substack.
MarkTechPost publicó una guía integral de ajuste fino para mejorar las capacidades de llamada a herramientas (tool-calling) usando el conjunto de datos XYZ-Aquila-SFT y el modelo Qwen3-0.6B.
Un nuevo estudio publicado en iScience muestra que GPT-4 puede predecir, con alta correlación, las respuestas colectivas que darán los participantes a encuestas de personalidad creadas por él mismo, antes de aplicarlas.
Un análisis de 14.419 libros autopublicados en Amazon revela que los libros generados por IA inundan el mercado con volumen, reduciendo los ingresos de los autores humanos.
Entrevistas de MIT Technology Review con jóvenes de 10 a 18 años revelan una amplia gama de reacciones ante la IA, desde la indiferencia hasta la preocupación ambiental.
Investigadores demostraron que un sistema multimodal basado en YOLO y CLIP puede distinguir mosquitos infectados a partir de grabaciones de video con alta precisión.
Investigadores desarrollaron un marco llamado SEAG que oculta información sensible antes de enviarla a modelos de lenguaje grande de terceros. El sistema responde correctamente a las consultas de los usuarios sin exponer datos confidenciales.
Un nuevo estudio firmado por Xin Shu, Zhen Lei y Ang Li propone límites más estrictos que los actuales para las probabilidades de causalidad multivaluadas.
Un nuevo estudio académico revela que los modelos de lenguaje grande (LLM), usados como jueces, cambian con frecuencia sus veredictos ante objeciones persistentes.
En un hackathon organizado por Hugging Face, 1.221 participantes usaron agentes de codificación para intentar reproducir las afirmaciones de 2.226 artículos aceptados en ICML 2026.
Según el informe de verano de 2026 de Hugging Face, los laboratorios chinos toman la delantera con modelos abiertos de billones de parámetros, mientras en EE. UU. el liderazgo pasó de los laboratorios de modelos a los fabricantes de hardware.