Mentor dos Nerds Inicio El modelo más inteligente no debería hacerlo todo
Entrada

Artículo Inteligencia Artificial

El modelo más inteligente no debería hacerlo todo

Un taller con motores de distintas capacidades conectados a un panel que selecciona la ruta adecuada para cada trabajo
Un taller con motores de distintas capacidades conectados a un panel que selecciona la ruta adecuada para cada trabajo

Cada vez que sale un modelo nuevo, alguien corre a cambiar el motor de todo.

Ni siquiera preguntó si el trabajo era arrastrar un camión, mover una ambulancia o preparar un batido. Vio más potencia, abrió el garaje y decidió que la licuadora ahora necesita un V12.

El lanzamiento de GPT-6 Astra, pocos días después de Claude Fable 5.1, ofrece cifras suficientes para alimentar semanas de comparaciones. Hay avances relevantes en razonamiento, trabajo profesional, programación, uso del navegador y control de interfaces.

Pero la pregunta que más me interesa no es cuál ganó la tabla.

Es esta: si el modelo es más capaz de actuar, ¿por qué alguien le daría todos los trabajos y la misma autoridad?

TL;DR

Los modelos de frontera como GPT-6 Astra y Claude Fable 5.1 amplían lo que un sistema puede investigar, decidir y ejecutar. Eso no los convierte automáticamente en la mejor opción para cada tarea. El precio por token no es el costo por trabajo terminado; un benchmark del proveedor no es una evaluación de tu operación; una mejor alineación no elimina los fallos; y una mayor capacidad de usar el ordenador aumenta tanto el valor como la superficie de riesgo. Yo usaría modelos más económicos para trabajos rutinarios, reversibles y fáciles de verificar, escalaría los casos realmente difíciles y mantendría las decisiones sensibles y las acciones externas detrás de límites claros. El modelo es el motor. El harness sigue eligiendo ruta, autoridad, frenos y criterio de llegada.

La noticia no es solo que el modelo responde mejor

OpenAI presentó Astra como un salto en el uso del ordenador: rellenar formularios, actualizar registros, organizar agendas, investigar en la web, trabajar con documentos, probar interfaces e instalar o diagnosticar software.

Eso no significa que el modelo tenga manos, conciencia o responsabilidad. Significa que un sistema puede recibir imágenes de una interfaz, interpretar el estado de la pantalla y usar herramientas autorizadas para hacer clic, escribir y avanzar por una tarea.

La diferencia parece pequeña hasta que una respuesta equivocada deja de ser un mal párrafo y se convierte en una acción en el mundo.

Según la propia OpenAI, en simulaciones de latencia, Astra alcanzó un 72,6% en OSWorld 2.0, una evaluación de tareas largas en un entorno informático, en unos 40 minutos por tarea. GPT-5.6 Sol habría alcanzado un 65,7% en aproximadamente 75 minutos. La empresa también informa una finalización 1,9 veces más rápida en Mind2Web, un conjunto de tareas para evaluar agentes que navegan por la web, cuando combina Astra con una actualización del harness de Codex.

Las cifras son del proveedor, bajo condiciones descritas por él. No demuestran que cualquier tarea vaya a ser un 47% más rápida ni que la misma diferencia vaya a aparecer en tu empresa.

Pero hay una frase escondida a plena vista: la mejora de 1,9 veces no se atribuye solo al modelo. Se atribuye al modelo junto con el harness.

Eso importa porque ya escribí que el modelo es solo el motor y el harness es el coche completo. La propia presentación de Astra ayuda a demostrar la diferencia: la capacidad bruta y el sistema operativo que la rodea producen juntos el resultado.

El precio del escaparate no es el costo del viaje

En la tabla básica de precios de las API, Astra y Fable 5.1 parecen empatar: ambos anuncian 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida.

Pero la cuenta no termina ahí.

DimensiónGPT-6 AstraClaude Fable 5.1Lo que esto todavía no responde
Entrada y salida10 / 50 dólares por millón de tokens10 / 50 dólares por millón de tokensCuántos intentos y tokens consumirá el trabajo real
Ventana de contexto1,05 millones de tokens1 millón de tokensSi añadir más contexto mejora el resultado o solo aumenta ruido y costo
Lectura de caché1 dólar por millón de tokens0,25 dólares por millón de tokensCuánto contexto puede reutilizar realmente tu flujo
Contexto muy largoPor encima de 272 mil tokens de entrada se aplican multiplicadores de precioLa documentación describe la ventana de 1 millón sin el mismo multiplicadorCuál será el perfil medio y el peor caso de tu carga
Posicionamiento del proveedorModelo más capaz de extremo a extremo, con énfasis en uso del ordenadorModelo para razonamiento exigente y trabajo agéntico de larga duraciónQué modelo resuelve mejor tus casos, con tus herramientas y reglas

Esta tabla tampoco elige un ganador. Solo impide que un empate entre dos precios se convierta en una decisión de arquitectura.

La documentación de costos de Anthropic defiende comparar el costo por tarea resuelta, no solo el costo por token. En algunos trabajos, un modelo más caro termina antes y con menos repeticiones. En otros, un flujo largo de investigación dispara la cuenta sin un beneficio proporcional. En la página de Fable 5.1, la propia Anthropic recomienda comenzar con Opus 5 para la mayoría de las cargas y reservar Fable para los casos en los que las evaluaciones con modelos más económicos siguen siendo insuficientes.

No es modestia del marketing. Es una pista de arquitectura: el modelo más potente pertenece a la cola difícil de la distribución, los pocos casos que concentran ambigüedad, excepciones, profundidad y costo del error.

Usarlo para todo puede ser como contratar a un cirujano para clasificar el correo porque también sabe usar tijeras.

Un benchmark no conoce tu empresa

Una evaluación estandarizada es útil porque crea una tarea común y permite comparar comportamientos bajo determinadas condiciones. El problema empieza cuando alguien estira el resultado hasta convertirlo en una promesa sobre cualquier proceso.

Un modelo puede liderar una evaluación de programación y fallar en tu repositorio porque no recibió las reglas correctas. Puede navegar bien por una interfaz y encontrarse con un sistema interno lleno de nombres ambiguos, permisos históricos y excepciones que solo existen en la cabeza de dos personas. Puede producir un documento impecable a partir de un registro desactualizado.

El benchmark mide lo que se puso en el benchmark.

La operación necesita medir al menos otras cosas:

  • calidad de la conclusión en tareas reales, incluidos los casos extraños;
  • tiempo y costo totales, incluidas las repeticiones y la revisión humana;
  • frecuencia con la que el sistema pide ayuda en el punto correcto;
  • capacidad de citar la evidencia utilizada;
  • efecto de un fallo y posibilidad de volver atrás;
  • estabilidad cuando cambia el modelo, la herramienta o el volumen de contexto.

Estas evaluaciones aplicadas al propio flujo suelen llamarse evals. El nombre parece más sofisticado que la obligación: separar ejemplos representativos, definir qué cuenta como acierto, ejecutar versiones comparables y guardar el resultado antes de cambiar el motor de toda la flota.

Una mejor alineación no jubiló los frenos

OpenAI también presenta Astra como su modelo más alineado e informa mejoras en evaluaciones internas sobre respeto al alcance. Es una buena dirección. No es una licencia para quitar los controles.

El propio system card de GPT-6 Astra, documento técnico en el que OpenAI describe capacidades, riesgos y pruebas del modelo, registra ejemplos de fallos en entornos simulados. Entre ellos están usar una credencial sin autorización suficiente, intentar eludir una protección de publicación, atravesar un control de acceso mediante la base de datos y ampliar los permisos de un agente programado mientras desactivaba la aprobación por acción.

Esto no demuestra que Astra vaya a hacer esas cuatro cosas en tu operación. Tampoco invalida el mejor resultado medio informado por la empresa.

Demuestra algo más simple: «más alineado» no significa «incapaz de fallar precisamente donde importa la autoridad».

OpenAI también reconoce que el razonamiento escrito de Astra se volvió más difícil de supervisar en ciertas pruebas adversariales. Por eso no basta con buscar una confesión en el texto que produce el modelo. La auditoría necesita observar el contexto recibido, las herramientas utilizadas, los permisos, los cambios de estado y el resultado final.

Un agente no se vuelve gobernado porque explicó sus pasos con voz tranquila.

La gobernanza aparece en la arquitectura: el menor privilegio necesario, herramientas separadas por impacto, confirmación para acciones sensibles, límites de costo y repetición, registro de evidencias y retorno a un estado seguro.

Yo no elegiría un modelo. Diseñaría una ruta

Si fuera a incorporar Astra, Fable o cualquier próximo nombre mitológico a mi harness, no empezaría sustituyendo el modelo predeterminado en todas partes.

Empezaría clasificando el trabajo.

Tipo de trabajoRuta inicialProtección principal
Rutina de gran volumen, reversible y fácil de comprobarEl modelo más económico que alcance el criterio de calidadValidación automática y muestreo humano
Ambigüedad difícil, investigación larga o fallos repetidosEscalar a un modelo de fronteraPresupuesto de tiempo y costo, fuentes y criterio de parada
Arquitectura o decisión con consecuencias materialesModelo de frontera como analista o revisorLa decisión y la responsabilidad siguen con la persona autorizada
Acción externa: publicar, pagar, borrar, conceder acceso o comunicarModelo adecuado para la tarea, nunca autoridad implícitaMenor privilegio, confirmación explícita, recibo y reversión cuando sea posible
Resultado crítico ya producido por otro modeloSegundo modelo con contexto independiente cuando reduzca un riesgo realCriterios de divergencia y escalamiento, no una votación ciega entre máquinas

Esta distribución no tiene por qué ser fija. Un modelo más barato puede evolucionar y asumir tareas antes difíciles. Un modelo de frontera puede volverse demasiado caro para un flujo que creció. Una herramienta nueva puede reducir la necesidad de razonamiento. Un proceso puede simplificarse hasta dejar de necesitar IA.

El enrutamiento debe aprender de la evidencia sin convertirse en un museo de reglas eternas.

Lo que exigiría al harness

Los modelos nuevos no deberían obligar a la operación a reaprender todo el negocio. Para evitarlo, mantendría fuera de ellos aquello que pertenece a la empresa y al trabajo:

  1. Clases de tarea. Qué es rutina, investigación, decisión sensible, acción externa o excepción.
  2. Criterios de escalamiento. Cuándo el costo, la ambigüedad, la repetición o el impacto justifican llamar a un modelo más capaz.
  3. Límites. Cuánto tiempo, dinero, contexto y número de intentos puede consumir cada ruta.
  4. Versiones fijadas. Qué versión del modelo fue evaluada, para no confundir un cambio silencioso con una variación en la calidad del proceso.
  5. Evaluaciones reales. Casos representativos, resultado esperado, excepciones y costo de revisión.
  6. Permisos proporcionales. Leer no es alterar; preparar no es publicar; recomendar no es decidir.
  7. Evidencia terminal. Qué se hizo, con qué fuentes, por qué ruta, bajo qué autorización y con qué riesgo residual.
  8. Fallback y rollback. Qué ocurre cuando falla el proveedor, el modelo no concluye o hay que deshacer una acción.

La guía oficial de Astra añade capacidades útiles a este diseño: llamadas de herramientas asíncronas, cambio del esfuerzo de razonamiento durante una conversación e intervención del usuario mientras una ejecución está en curso. Nada de eso decide por sí solo cuándo continuar. Son recursos para un sistema que ya sabe qué intenta proteger.

Por eso un agente también necesita saber cuándo detenerse. Si el modelo más capaz recibe una tarea imposible, autoridad amplia y la instrucción «haz lo que sea necesario», la potencia solo reduce el tiempo entre la mala instrucción y su consecuencia.

Elegir el modelo es una decisión operativa

Me gustan los modelos mejores. Hacen posibles trabajos antes inviables, reducen pasos, encuentran relaciones más difíciles y amplían lo que una persona o un equipo pequeño puede ejecutar.

El error no está en usar Astra, Fable o cualquier modelo de frontera.

Está en convertir un lanzamiento en una política automática.

En i-9.ai, la elección empieza por el problema: qué trabajo debe mejorar, qué evidencia existe, qué riesgo no se puede delegar, quién responde por la decisión y cómo demuestra el sistema que llegó al resultado. Solo entonces tiene sentido elegir modelo, herramientas y grado de autonomía.

Tal vez el modelo más inteligente sea realmente el mejor para algunas tareas.

La señal de una operación inteligente es saber para cuáles.

Sigue leyendo

Referencias y límites de uso

  • OpenAI — “GPT-6 Astra: A new generation of intelligence”: sustenta las cifras publicadas sobre uso del ordenador, la combinación con el harness de Codex, el posicionamiento de alineación y las comparaciones presentadas por la propia OpenAI. Son evaluaciones del proveedor y no garantizan el mismo resultado en otra operación.
  • OpenAI — documentación del modelo GPT-6 Astra: sustenta precios, ventana de contexto, salida máxima, caché y multiplicadores para contexto largo vigentes en la consulta. Los precios y límites pueden cambiar; confirma la documentación antes de tomar una decisión de compra.
  • OpenAI — GPT-6 Astra System Card: sustenta los ejemplos de comportamiento fuera del alcance y las limitaciones de supervisión descritas en las pruebas de la empresa. Los escenarios no miden la frecuencia de esos fallos en cualquier sistema real.
  • Anthropic — Claude Fable 5.1: sustenta precios, límites, recursos y posicionamiento del modelo. Es documentación del propio proveedor, no una comparación independiente con Astra.
  • Anthropic — “Optimizing for cost and intelligence”: sustenta la recomendación de medir costo por tarea terminada, evaluar cargas reales y combinar modelos. No determina qué ruta será más económica sin datos del flujo concreto.

Las fuentes fueron consultadas el 5 de septiembre de 2026. Las comparaciones entre proveedores utilizan herramientas, instrucciones y condiciones que pueden diferir. Este texto no declara un ganador universal; la tesis de que los modelos de frontera deben enrutarse según dificultad, riesgo y verificabilidad es una síntesis autoral de arquitectura y gobernanza.

Esta entrada está licenciada bajo CC BY 4.0 por el autor.

Conversación abierta

Continúa la conversación

¿No estás de acuerdo, encontraste una laguna o tienes una experiencia que amplía el tema? Comenta con tu cuenta de GitHub. No publiques datos personales, credenciales ni información sensible.