Dario Amodei o Sam Altman, entre otros, apoyan un desarrollo más pausado. Son sus empresas, Anthropic y OpenAI, las que lideran el sector.[…]
La entrada Qué modelos dominan el panorama de la IA en un momento en el que cada vez más voces piden ponerle freno se publicó primero en Marketing4eCommerce.
El ritmo acelerado al que evoluciona el desarrollo de la IA es directamente proporcional a las preocupaciones que suscita. El temor ante el avance desbocado de esta tecnología sin que todavía exista un marco regulatorio claro en torno a ella (que cubra desde los límites de sus capacidades hasta cuestiones éticas y de impacto social, laboral y económico) ya no es exclusivo de la gente de a pie; ha alcanzado a los líderes del sector.
A finales de agosto, el magnate y filántropo creador de Microsoft Bill Gates publicaba un ensayo en su blog personal en el que cuestionaba cómo se está abordando la transición a la era de la IA y afirmaba no ver “indicios de que los líderes, expertos y comunidades estén afrontando los desafíos de IA adecuadamente“. Este fin de semana le ha tocado el turno a Dario Amodei, CEO de Anthropic, quien ha manifestado que “debemos ralentizar el ritmo al que mejoramos las capacidades de los modelos de IA“ en una amplia reflexión en su blog.
Amodei ha planteado una serie de propuestas entre las que destacan la participación de “evaluadores integrados” pertenecientes a organizaciones externas e independientes, establecer una “coordinación democrática” entre empresas acordando estándares comunes y límites de desarrollo y llevar a cabo una “coordinación global” a través de la cual tanto países democráticos como autoritarios forjen alianzas para verificar el cumplimiento.
Por su parte, Sam Altman, CEO de OpenAI, se ha mostrado de acuerdo con Amodei y ha anunciado que desde su compañía se comprometen “a tener evaluadores independientes con acceso similar al de los empleados“.
I agree with Dario that we need to pace the frontier. This has been a primary topic of discussions we’ve had at OpenAI in recent weeks.
Committing to having independent evaluators with employee-like access is a great idea, and we will do the same. We’ll have more to share soon. https://t.co/1YhhIybZX7
— Sam Altman (@sama) September 12, 2026
Si bien estas declaraciones de intenciones arrojan una pequeña luz de esperanza ante un futuro incierto en el que, como manifestaba Gates, “la IA será o bien el mayor igualador jamás inventado, o bien la peor fuente de injusticia“, conviene analizar el panorama actual.
Para ello, hemos decidido basarnos en los datos de Artificial Analysis, una de las principales plataformas independientes de análisis y comparación de modelos de IA, más concretamente en su índice de referencia, el Intelligence Index v4.3.
Fuente: Artificial AnalysisAnthropic y OpenAI comparten la coronaComo podemos apreciar, Anthropic y OpenAI encabezan este ranking (contando ambas con varios modelos bien posicionados). Que cada cual saque sus conclusiones en torno a si ser líder facilita el pedir una pausa en el desarrollo o al contrario.
Tanto Claude Fable 5.1 como GPT-6 Astra obtienen una puntuación de 53 en el índice. Ambos modelos fueron lanzados a principios de septiembre y despertaron un gran interés en la audiencia debido a sus capacidades de razonamiento mejoradas y sus habilidades de ejecución de tareas complejas mediante agentes.
Ahora bien, profundizando en los benchmarks de Artificial Analysis, observamos que ambas IAs empatan en rendimiento y comparten la misma tarifa ($10 por millón de tokens de entrada y 50$ por los de salida) y una velocidad de respuesta por debajo del promedio (65,1 tokens de salida por segundo en Fable 5.1 vs. 59,8 en Astra). La diferencia más destacada entre ellas radica en que Fable 5.1 termina siendo más caro de usar que GPT-6 Astra debido a su estilo de respuesta. Mientras que GPT-6 Astra es eficiente al generar solo 60M de tokens (5.324,10$ en total), Fable 5.1 se extiende más (190M de tokens), elevando su evaluación a 13.128,86$.
El tercer y cuarto puesto del ranking también son para dos modelos de Anthropic: Claude Opus 5 (51) y Claude Fable 5 (50). El primero se trata de un modelo inteligente y proactivo destinado al uso diario cuyas capacidades se sitúan cerca de las de Claude Fable 5, pero a mitad de precio. Por su parte, Claude Fable 5 revela un gran desempeño en ingeniería de software, gestión del conocimiento, visión artificial e investigación científica, entre otras áreas.
Es en la quinta posición donde por fin encontramos un modelo de IA perteneciente a una compañía distinta, pero igualmente conocida. Muse Spark 1.3 de Meta alcanza una puntuación de 48 en el índice de inteligencia. De acuerdo con los datos del benchmark, esta IA destaca por su alta velocidad (228 tokens de salida por segundo), precio competitivo y soporte multimodal (texto, imagen, vídeo). Su único inconveniente es su verborrea, generando 170 millones de tokens en su evaluación, frente a la mediana de 90 millones.
Sorprende que la primera posición que ocupa un modelo de Google (Gemini 3.8 Flash) sea la decimosegunda. Con una puntuación de 41, esta IA es muy veloz (277,5 tokens por segundo), económica y versátil, ya que admite texto, imagen, audio y vídeo. Aunque en la evaluación realizada por Artificial Analysis costó 1.622,73$ gracias a su buen precio, resulta muy “hablador”, pues también generó 170 millones de tokens.
Si analizamos las diez primeras posiciones del ranking, descubrimos que solo dos de las IAs clasificadas no pertenecen a Estados Unidos (GLM-5.3 y Kimi K3, ambas de origen chino). Sin embargo, si ampliamos el foco y tenemos en cuenta los 25 modelos listados, comienza a apreciarse una mayor variedad de procedencia.
De las 25 IAs, 15 son de Estados Unidos, 8 de China, una de Emiratos Árabes (K2 Horizon 375B A23B) y una de Francia (Mistral Medium 3.5). Queda claro qué dos países van a la cabeza en cuanto a desarrollo de esta tecnología. Concretamente, los modelos chinos son:
GLM-5.3 se posiciona entre los modelos de inteligencia líderes con una puntuación de 45 en el índice de inteligencia de Artificial Analysis. Este se trata de un modelo enfocado únicamente en texto que ofrece una ventana de contexto de 1 millón de tokens. Sin embargo, resulta caro en comparación con otros modelos similares, además de ser algo lento (72 tokens por segundo) y muy “hablador” (en la prueba generó 210 millones de tokens).
En cuanto a Kimi K3, esta IA obtuvo una puntuación de 44 en el índice. El modelo admite entrada de texto e imagen con una ventana de contexto de 1 millón de tokens. No obstante, es un modelo de ponderación abierta bastante lento (37 tokens por segundo) y caro.
Regular el presente para asegurar un futuroComo ves, el sector de la IA generativa es amplio y en él participan diversos agentes, no solo OpenAI, Anthropic o Google. Esto significa que, para asegurar un desarrollo seguro, ético y respetuoso tanto con el medioambiente como con la humanidad, se necesita una regulación sólida que se ajuste a los desafíos actuales y futuros que plantea la transición a la era de la IA. Una era, en la que ya hemos entrado y cuyos efectos ya estamos sintiendo (a nivel social, laboral, medioambiental y educativo).
No basta con dejar el control y la fijación de límites en manos de las propias desarrolladoras, ya que corremos el riesgo de que sus intereses pesen más que el bienestar común.
Foto: generada con ChatGPT Image 2.5