AI RADARМоделі
239•09/07/2026, 11:15•4 min
OpenAI: SWE-Bench Pro ya no es adecuado para la evaluación de modelos
#OpenAI#benchmarks#AI models#SWE-Bench Pro

OpenAI ha anunciado que SWE-Bench Pro tiene problemas graves que socavan su efectividad. Están pidiendo el desarrollo de nuevos benchmarks para la prueba de modelos.
AI Radar • Nivel Plus
Análisis completo disponible en el plan Plus
Revisiones técnicas diarias, benchmarks y casos prácticos de vibe coding se desbloquean en el plan Plus.
Debatir en la comunidad
Діліться своїм досвідом та думками з ШІ-розробниками
Leer más
Todas las noticiasМоделі295
OpenAI: modelo de IA interno resolvió más de 100 problemas matemáticos abiertos en menos de un mes
22/09/2026, 07:33
Моделі185
Xiaomi lanza MiMo-V2.6: nuevo modelo de IA abierto supera a la competencia
22/09/2026, 04:54
Моделі223
Notas de una investigadora de OpenAI para preparación de entrevistas en IA
22/09/2026, 04:17