¿Han descubierto los investigadores una nueva «ley de escala» de AI? Eso es lo que sugiere algunos zumbidos en las redes sociales, pero los expertos son escépticos.
Las leyes de escala de IA, un poco de concepto informal, describen cómo el rendimiento de los modelos de IA mejora a medida que aumenta el tamaño de los conjuntos de datos y los recursos informáticos utilizados para capacitarlos. Hasta hace aproximadamente un año, la ampliación del «pre-entrenamiento» (entrenamiento de modelos cada vez más grandes en conjuntos de datos cada vez mayores, era la ley dominante con mucho, al menos en el sentido de que la mayoría de los laboratorios de IA fronterizos la adoptaron.
La capacitación no ha desaparecido, pero han surgido dos leyes de escala adicionales, la escala posterior al entrenamiento y la escala de tiempo de prueba, para complementarla. La escala posterior al entrenamiento es esencialmente ajustar el comportamiento de un modelo, mientras que la escala de tiempo de prueba implica aplicar más computación a la inferencia, es decir, modelos de ejecución, para impulsar una forma de «razonamiento» (ver: modelos como R1).
Los investigadores de Google y UC Berkeley recientemente propusieron en un documento lo que algunos comentaristas en línea han descrito como una cuarta ley: «búsqueda de tiempo de inferencia».
La búsqueda en el tiempo de inferencia tiene un modelo que genera muchas respuestas posibles a una consulta en paralelo y luego seleccione la «mejor» del grupo. Los investigadores afirman que puede aumentar el desempeño de un modelo de un año, como el Gemini 1.5 Pro de Google, a un nivel que supera el modelo de «razonamiento» de previsión O1 de OpenAI en puntos de referencia de ciencias y matemáticas.
Nuestro artículo se centra en este eje de búsqueda y sus tendencias de escala. Por ejemplo, simplemente muestreando al azar 200 respuestas y autoverificaciones, Géminis 1.5 (¡un antiguo modelo de 2024 a principios de 2024!) Beats O1 previa y enfoques O1. Esto es sin verificadores Finetuning, RL o Tround-Truth. pic.twitter.com/hb5fo7ifnh
– Eric Zhao (@Ericzhao28) 17 de marzo de 2025
«[B]Y solo muestrean al azar 200 respuestas y severifican, Gemini 1.5, un antiguo modelo de principios de 2024, supera la previa vista O1 y se acerca a O1 «, Eric Zhao, un Doctorado de Google y uno de los coautores del artículo, escribió en una serie de publicaciones en X.» La magia es que la autoverificación se vuelve más fácil a escala! Esperaría que elegir una solución correcta se vuelva más difícil cuanto más grande sea su grupo de soluciones, ¡pero lo contrario es el caso! ”
Sin embargo, varios expertos dicen que los resultados no son sorprendentes y que la búsqueda de tiempo de inferencia puede no ser útil en muchos escenarios.
Matthew Guzdial, investigador de IA y profesor asistente de la Universidad de Alberta, le dijo a Tecno que el enfoque funciona mejor cuando hay una buena «función de evaluación», en otras palabras, cuando la mejor respuesta a una pregunta se puede determinar fácilmente. Pero la mayoría de las consultas no son tan cortadas.
«[I]f no podemos escribir código para definir lo que queremos, no podemos usar [inference-time] búsqueda «, dijo. […] Generalmente no es un gran enfoque para resolver la mayoría de los problemas «.
Mike Cook, miembro de la investigación del King’s College London especializado en IA, estuvo de acuerdo con la evaluación de Guzdial, y agregó que destaca la brecha entre el «razonamiento» en el sentido de la IA de la palabra y nuestros propios procesos de pensamiento.
«[Inference-time search] No ‘eleva el proceso de razonamiento’ del modelo «, dijo Cook.[I]Es solo una forma de trabajar en torno a las limitaciones de una tecnología propensa a cometer errores respaldados con mucha confianza […] Intuitivamente si su modelo comete un error el 5% del tiempo, entonces verificar 200 intentos en el mismo problema debería hacer que esos errores sean más fáciles de detectar «.
Esa búsqueda en el tiempo de inferencia puede tener limitaciones seguramente será una noticia desagradable para una industria de IA que busca ampliar el «razonamiento» del modelo de eficiencia. Como nota de los coautores de la nota de papel, los modelos de razonamiento de hoy pueden acumular miles de dólares en la informática en un solo problema matemático.
Parece que la búsqueda de nuevas técnicas de escala continuará.








