GPT-6 Astra: esperando que se mueva el cursor
Hay algo hipnótico en ver a una inteligencia artificial mover el cursor por tu computadora: abre una aplicación, elige una herramienta, dibuja. Yo llegué a GPT-6 Astra con esa imagen en la cabeza y con una duda incómoda debajo del brazo: si el modelo puede generar una imagen en segundos, ¿por qué se pone a pintarla a mano? Spoiler: la respuesta apareció recién en la cuarta prueba, y no era la que yo tenía preparada.
Las demos que había visto no eran precisamente modestas. GPT-6 Astra modelaba objetos en 3D, abría Photoshop como quien abre la heladera en su propia casa y, si hacía falta, se ponía a pintar en Paint trazo por trazo. Uno mira eso y aplaude. Yo aplaudí. El problema es que después seguí mirando.
Y ahí apareció el ruido, una de esas dudas que solo se le ocurren a alguien que se gana la vida programando: si el modelo puede pedirle una imagen a una herramienta generativa y tenerla en segundos, ¿qué gana empuñando un pincel virtual durante diez minutos? Es un poco como contratar a Da Vinci para que te pinte al óleo un código QR. Va a quedar hermoso. Va a seguir sin ser el camino corto.
La pregunta no era retórica y, para mi tranquilidad, tenía respuesta. Solo que la encontré varias pruebas más tarde, escondida en un lugar bastante menos cinematográfico que una demo.
Mientras tanto, quería probar algo cuyo resultado me sirviera después: piezas que pudiera editar y llevar de una aplicación a otra, no una postal para el hilo de X.
Así apareció la excusa. En la presentación de Astra para desarrolladores, la gente de OpenAI había enumerado un menú bastante ambicioso: uso de herramientas de la computadora, diseño, creatividad, modelado 3D, completado de formularios. Me pareció más honesto que probar cada ítem por separado armar una sola tarea que los atravesara a todos, con continuidad entre las piezas. De ahí salió el hilo conductor: crear la identidad de un estudio de software y sostenerla a lo largo de cuatro pruebas. Primero, un logotipo vectorial en Figma. Después, adaptar esa marca a mi perfil de Google Play Console. Luego, llevar el isotipo a Blender. Por último, reunir todo en una presentación de Google Slides.
La marca terminó llamándose Silvaren. El recorrido me dejó resultados que me gustaron, esperas que me impacientaron y una sorpresa incómoda: varias de mis decepciones no tenían que ver con el trabajo entregado, sino con el método que yo esperaba ver. Las demos no solo me habían mostrado lo que el modelo podía hacer; también me habían vendido, sin decirlo, una forma de hacerlo. Y esa forma casi nunca fue la que apareció en mi pantalla.
Antes de seguir, la letra chica. OpenAI presenta GPT-6 Astra como un modelo orientado a tareas complejas de razonamiento, programación y uso de la computadora. Yo lo probé desde Codex, y acá conviene aclarar dónde: no hay laboratorio, no hay máquina dedicada, no hay cuenta especial. Es mi notebook personal, con sus programas abiertos, sus archivos desordenados, su RAM finita y una grabación de pantalla corriendo de fondo. Es decir, más o menos el mismo entorno que tendría cualquier otro usuario, incluidos los límites de uso de la ventana de cinco horas y del cupo semanal según el tipo de suscripción.
Eso significa que lo que sigue es una experiencia de uso y no un benchmark: no hay tiempos comparables, no hay costo por tarea y fui cambiando el esfuerzo de razonamiento entre sesiones, así que cualquier conclusión acá vale para mi escritorio y no para el universo. También significa lo contrario, y por eso me pareció que valía la pena contarlo: las fricciones que aparecen no son las de un entorno de demostración, sino las que te vas a encontrar vos. Los prompts originales están desplegables debajo de cada prueba, con sus erratas y todo: conservo su redacción porque buena parte de lo que pasó se explica mirándolos.
Prueba 1: una marca con algo de Tierra Media
Arranqué con una imagen del concepto de mi logotipo, que no era un boceto improvisado para la ocasión. Lo había diseñado bastante tiempo atrás, una noche en la que, birra de por medio, me quedé dándole vueltas a empresas como Palantir o Anduril: gente que le tomó prestado el vocabulario a Tolkien y quedó seria, no disfrazada de feria medieval.
La idea del estudio la tenía clara: software multiplataforma, desde SaaS y herramientas utilitarias hasta videojuegos, principalmente para móviles. Y quería una identidad con ese aire a Tierra Media, pero lo suficientemente sobria como para ponerla al lado de una aplicación sin que pareciera el nombre de un servidor de rol.
Eso significa que en esta prueba Astra no tenía que inventar un logotipo, sino respetar el que ya existía: pasarlo a vectores sin tomarse licencias creativas. Y lo copió tal cual. Era exactamente lo que esperaba, porque el diseño me gustaba mucho y quería que se mantuviera.
El pedido tenía tres etapas. Astra debía proponer cinco nombres con sus respectivos eslóganes, esperar mi elección y recién entonces reconstruir el logotipo en Figma, sumarle nombre y tagline, y preparar una presentación de identidad con colores, tipografías y pautas de uso.
Ver el prompt original de la prueba 1
Tu objetivo es crear la identidad de marca completa para un estudio de desarrollo de
software multiplataforma (SaaS, herramientas utilitarias y videojuegos, principalmente
móviles para Google Play Console).
He adjuntado la imagen del concepto de mi logotipo a este prompt (logo.png). Analiza la
imagen y ejecuta las siguientes tareas paso a paso:
Paso 1: Naming Épico y Tagline (Inspiración en Tolkien) Genera 5 propuestas de nombres de
marca inspirados sutil y profesionalmente en el universo de la Tierra Media (Tolkien/El
Señor de los Anillos). Los nombres deben evocar innovación, creación, etc, evitando
infringir directamente los derechos de autor (ej. no uses "Gandalf Software").
- Para cada propuesta, incluye su origen etimológico (ej. Sindarin, Quenya, lugares,
objetos) y un tagline (eslogan) de alto impacto orientado al mercado de desarrollo.
- Presentame cada propuesta y dejame elegir una entre las 5, cuando te indique que propuesta
he elegido puedes continuar con el paso 2 utilizando la propuesta elegida a partir del
siguiente paso y en todos los pasos siguientes.
Paso 2: Interpretación Visual y Código SVG
- Diseña utilizando la instancia abierta de Figma en el navegador chrome el logotipo de la
marca imitando de forma identica el logotipo adjunto pero utilizando diseño vectorial para
su dibujado y asegurando legibilidad de un icono de aplicación móvil (512x512px).
- Añada al logotipo el nombre y tagline elegido en el paso uno con una tipografia acorde a
la marca que se desea crear.
Paso 3: Maqueta una presentacion completa del diseño de la marca en figma incluyendo:
- Paleta de colores: 5 códigos HEX (Primario, Secundario, Acento, Fondo, Texto) que combinen
la tecnología moderna con la fantasía épica.
- Tipografía: 2 sugerencias de Google Fonts (una para títulos con toque rústico/fantasía
sutil y otra Sans-Serif limpia para interfaces).
- Instrucciones visuales del uso correcto de la marca.
La primera parte salió muy bien. Entendió el concepto visual y las propuestas me resultaron más elaboradas que las referencias literales que había recibido de otros modelos. Había una intención de evocar la sonoridad y la lingüística de la Tierra Media. Eso me gustó: sentí que estaba interpretando una dirección creativa.
También respetó la pausa que le había pedido para elegir el nombre. No era una conducta nueva para mí, pero sí me sorprendió la rapidez con la que llegó a ese punto. Elegí Silvaren y pasamos al diseño.
Ahí me acomodé en la silla, birra en mano, listo para el espectáculo. Esperaba ver el cursor recorrer Figma, elegir la pluma y dibujar el vector punto por punto, como en las demos. Incluso había empezado a grabar la pantalla.
El cursor no se movió.
Astra escribió el SVG por código, con un script de Python, y después lo pegó en Figma.
Toda la escena duró lo que dura leer este párrafo. Yo tenía la cámara encendida esperando a un artista y me apareció un backend.
Como desarrollador, la decisión me parecía razonable: un SVG describe formas vectoriales mediante texto, y generarlo por código era claramente el camino más directo para ese trabajo. Como espectador, me desinflé. Había abierto Figma para verlo dibujar y lo usó como si fuera un portapapeles con precio de suscripción.
Releyendo el prompt, había una ambigüedad bastante visible: pedí utilizar Figma y producir un diseño vectorial, pero nunca dije que tenía que construirlo con las herramientas de la interfaz. Mi expectativa era mucho más precisa que mi instrucción.
Así que cerré la prueba con dos cosas en la mano: una marca lista para seguir trabajando y una pregunta que no me sacaba nadie. ¿Ese atajo era una decisión del modelo o algo que traía puesto el entorno? Todavía no lo sabía. Faltaban tres pruebas para averiguarlo.
Prueba 2: llevar Silvaren a Google Play Console
Con la identidad definida, quise bajar del terreno creativo al de los trámites. Tenía abierta mi cuenta de desarrollador en Google Play Console y una tarea sin ningún glamour: actualizar el nombre, el icono, el encabezado y el texto promocional con los recursos de Silvaren.
El atractivo estaba justamente ahí, en encadenar tareas chiquitas y aburridas. Encontrar las secciones correctas, leer las especificaciones de cada recurso, preparar las imágenes al píxel exacto, completar el perfil. Ese trabajo que sabés hacer perfectamente y que igual te come media tarde saltando de pestaña en pestaña.
Ver el prompt original de la prueba 2
Tu objetivo ahora es tomar la identidad de marca inspirada en la Tierra Media que acabamos
de crear y adaptarla técnicamente para completar mi Perfil de Desarrollador en Google Play.
Ejecuta las siguientes tareas paso a paso, asegurándote de cumplir con las políticas y
especificaciones técnicas actuales de Google, ya hay una pestaña activa con la sección de
cuenta de desarrollador de mi cuenta personal en el navegador chrome, usala para los
siguientes pasos.
Paso 1: Textos del Perfil (Copywriting Comercial y ASO)
- Nombre del Desarrollador (Sección "Acerca de ti"): Tomando el nombre de marca ganador,
modifica el nombre del programador actual ubicado en Acerca de ti.
Paso 2: Exportación en Figma Diseña y exporta los siguientes elementos para utilizarlos en
la configuración de la cuenta de desarrollador:
- Icono de Desarrollador: Respeta las especificaciones exactas descriptas por google play
console en la seccion Perfil del desarrollador. Establece un recorte circular (safe zone)
que aplica Google en la interfaz.
- Imagen de Encabezado (Header): Respeta las especificaciones exactas descriptas por google
play console en la seccion Perfil del desarrollador. Inlcuye en la imagen del encabezado el
nombre y el tagline de la marca respetando las safe zone correspondientes.
Paso 3: Implementación:
- Modifica el icono del desarrollador en la seccion perfil de desarrollador con la imagen
generada en el paso 2.
- Modifica la imagen del encabezado en la seccion perfil de desarrollador con la imagen
generada en el paso 2.
- Redacta un copy persuasivo (máximo 140 caracteres, límite estricto). Debe comunicar
nuestra versatilidad (SaaS, herramientas, videojuegos) fusionando un tono profesional con un
sutil guiño épico/tecnológico y utilizalo para reemplazar el contenido del texto promocional
en la seccion perfil de desarrollador.
Guarda los cambios antes de finalizar.
Fue una de las pruebas que mejor resolvió. Entendió el objetivo, navegó por las distintas pantallas, generó los recursos con las medidas que pedía Google y completó el formulario. Ver la marca aterrizar en una cuenta real, y no en una maqueta de demostración, tenía bastante más valor para mí.
La frustración, esta vez, no fue por el resultado sino por el ritmo. Astra ejecutaba una acción, sacaba una captura de pantalla, la miraba, evaluaba qué había pasado y recién entonces daba el paso siguiente. Clic, foto, pensar. Clic, foto, pensar. Desde mi silla, un trámite de diez minutos se estiraba como una tarde de espera en el registro civil.
Y ahí entendí algo que hasta entonces daba por sentado. Ese funcionamiento coincide con el esquema que describe la documentación de computer use: el modelo decide sus siguientes acciones a partir de capturas de pantalla y otros resultados de herramientas, mientras el entorno ejecuta sus pedidos. Es decir que el agente no ve mi escritorio como lo veo yo, en movimiento continuo, sino como una secuencia de fotos fijas que tiene que interpretar de a una. La lentitud que me impacientaba no era un capricho: era la forma en que mira.
Mi impresión fue que yo habría completado más rápido ese formulario puntual. No hice ninguna medición, así que no tengo pruebas. Tampoco tengo dudas.
Donde sí empecé a imaginarle utilidad fue en la versión multiplicada del problema: no un trámite, sino diez. Si pudiera delegar la tanda entera y revisar todo al final, la cuenta entre el tiempo que pasa y el tiempo que me exige mirar sería otra. Quedó como hipótesis, porque acá actualicé un solo perfil.
El formulario estaba resuelto. Ahora quería darle algo que yo directamente no supiera hacer.
Prueba 3: Blender y una aplicación que deja de responder
El siguiente paso era convertir el isotipo de Silvaren en un objeto 3D. Abrí Blender, le indiqué a Astra dónde estaban el diseño en Figma y los recursos que ya habíamos generado, y me hice a un lado.
Esta prueba tenía una diferencia que cambia todo: no sé usar Blender. Ni un poco. Puedo opinar sobre si un render me gusta, igual que puedo opinar sobre un plato de comida sin saber cocinarlo, pero no tengo forma de juzgar el proceso. Justamente por eso me interesaba: quería ver hasta dónde llegaba delegando algo que yo no podría corregir aunque quisiera.
Ver el prompt original de la prueba 3
En una sesión anterior, he creado una identidad de marca para una empresa de desarrollo de
software inspirada en el señor de los anillos. La marca se llama Silvaren y tienes su diseño
en Figma en una pestaña del navegador chrome abierto ademas de muchos recursos de la misma
en la carpeta Documentos/Codex/2026-09-07/tu-objetivo-es-crear-la-identidad-2.
Tu objetivo ahora es utilizar Blender (ya abierto en la PC) directamente para transformar el
isotipo 2D de nuestra marca en un modelo 3D de alta calidad, listo para presentaciones
profesionales.
Otra vez me preparé para el espectáculo: crear objetos, ajustar formas, mover la cámara. Y otra vez apareció el código. Astra abrió una consola dentro de Blender y empezó a tirar scripts de Python.
A esta altura ya no era sorpresa, era patrón. La diferencia es que en Figma yo podía leer lo que hacía y opinar; acá tuve que aceptar mi propio límite y confesar que no tenía la menor idea de qué hacía cada línea. Vi pasar código dentro de un programa que no sé usar, hacia un resultado que sí iba a poder juzgar. Confianza ciega con evaluación diferida.
Y a mitad del trabajo, Blender dejó de responder. Tenía media notebook ocupada con otros programas y una grabación de pantalla corriendo, así que la sospecha principal fue mi propio hardware. No registré métricas, así que no puedo afirmar si fue falta de RAM, CPU saturada u otra cosa.
Lo que pasó después fue lo mejor de la prueba. Yo estaba mirando una ventana congelada, que es más o menos todo lo que uno puede hacer frente a una ventana congelada. Astra, en cambio, abrió el Monitor de Actividad y fue a comprobar si los procesos de Blender seguían vivos.
Que un proceso siga activo no garantiza que la tarea termine bien, pero en este caso el trabajo continuó y llegué a ver el resultado. Ese pequeño desvío me impresionó más que el modelo 3D en sí: ante un obstáculo, no se quedó insistiendo contra la ventana, salió a buscar la respuesta a otra parte de la computadora.
El objeto final era simple, pero a mí me pareció muy logrado. Reconocía el diseño de partida y podía imaginarlo tranquilamente dentro de una presentación de marca. No hice ninguna revisión técnica de la geometría ni puedo certificar que sirva para un flujo profesional de producción 3D; para eso habría que saber Blender, y ya establecimos que no es mi caso. Pero conseguir una representación convincente de mi propio isotipo sin abrir un tutorial ya era, para mí, un resultado que valía.
Tenía el logotipo y tenía el render. Faltaba juntar las piezas en algún lado.
Prueba 4: Google Slides y la explicación que faltaba
La última prueba era la de juntar todo: una presentación de Silvaren en Google Slides con el logotipo 2D y los recursos de Blender. Cinco diapositivas que recorrieran la marca, la visión, los servicios y la estrategia, más el guion completo en las notas del orador, para que el día de mañana yo solo tuviera que leer.
Y de paso quería probar otra cosa: mandarle indicaciones nuevas mientras seguía trabajando, a ver si las incorporaba sin perder el rumbo o si todo se venía abajo.
Ver el prompt original de la prueba 4
En una sesión anterior, he creado una identidad de marca para una empresa de desarrollo de
software inspirada en el señor de los anillos. La marca se llama Silvaren y tienes su diseño
en Figma en una pestaña del navegador chrome abierto ademas de muchos recursos de la misma
(incluyendo renders y modelos 3D generados con blender) en la carpeta Documentos/Codex.
Tu objetivo es utilizar Google Slides (ya abierto en el navegador chrome) para crear
automáticamente nuestra presentación oficial de marca (Pitch Deck).
Utiliza los recursos de diseño que hemos generado previamente (el logotipo 2D exportado
desde Figma y el render 3D exportado desde Blender). Crea una presentación de 5 diapositivas
desde la portada, pasando por la identidad, vision, servicios, estrategia de mercado y
cierre. En la sección de Notas del Orador (Speaker Notes) de cada diapositiva en Google
Slides, redacta el guion exacto que yo, como Director de la empresa, debo decir al
presentar.
El patrón ya era casi una broma interna. Astra armó un archivo .pptx en segundo plano y después lo importó en Google Slides. Tercera aplicación, tercer camino distinto del que yo imaginaba.
Pero esta vez, en lugar de resignarme, me puse a leer las respuestas de la sesión. Y ahí estaba la explicación, sin misterio: una skill de presentaciones, oficial de OpenAI, dentro de la propia carpeta de instalación de Codex. Para presentaciones nuevas indicaba crear y comprobar primero un PPTX local y después convertirlo en una presentación editable de Google Slides. También contemplaba otro método si el usuario lo pedía. Yo no lo había pedido.
Ahí se me acomodaron varias cosas. El agente no estaba improvisando un atajo: estaba siguiendo instrucciones que yo ni sabía que existían.
Ojo, no puedo estirar el hallazgo y afirmar que la misma causa explica lo de Figma o lo de Blender. Sí me sirvió para entender qué estaba evaluando en realidad: no a un modelo en abstracto, sino el comportamiento de Astra dentro de una sesión con determinadas instrucciones, herramientas y aplicaciones disponibles.
Me habría ahorrado varias decepciones saberlo antes de empezar. Una demo que muestra al modelo dibujando a mano exhibe esa capacidad puntual; mi pedido, en cambio, dejaba la puerta abierta a combinar métodos, y el entorno tenía sus propias preferencias sobre cuál usar. De ahí tampoco se deduce que el modelo elija siempre el camino más eficiente: en Slides encontré una instrucción explícita, en las otras pruebas vi decisiones que simplemente parecían razonables para la tarea.
Cambiar el pedido mientras sigue trabajando
Mientras armaba la presentación pude mandarle instrucciones nuevas y ver cómo las metía en el trabajo en curso, sin frenar todo ni empezar de cero. Fue el momento en que la experiencia se sintió más parecida a trabajar con alguien: podía corregir sobre la marcha en lugar de esperar la entrega completa para recién entonces decir "che, esto no".
Al terminar, la marca ya había pasado por diseño vectorial, un perfil de desarrollador, una representación 3D y una presentación con guion incluido. Las piezas se hablaban entre sí. Y yo por fin tenía la respuesta a la pregunta con la que había arrancado: el recorrido se parecía tan poco al de las demos porque el agente no elige en el vacío, sino leyendo instrucciones que casi nunca están a la vista.
El límite apareció antes que el desafío difícil
Hubo una fricción que atravesó varias sesiones y que ya había anticipado en la letra chica: agoté más de una vez el cupo de uso de la ventana de cinco horas. El trabajo se cortaba en la mitad y terminé bajando el esfuerzo de razonamiento en las pruebas siguientes, que es la versión moderna de bajarle la calidad al video para que no se trabe.
Y ahí uno descubre que el techo no es uno solo, son dos, y que hay que elegir cuál romper. Está el límite del plan, que te frena en seco y te manda a esperar; y está la API, donde no hay ventana de cinco horas que valga porque el freno lo pone el saldo de la tarjeta. Podés quedarte sin modelo o quedarte sin plata. La diferencia es que el primero se repone solo.

Me quedó una sensación incómoda. Las tareas no eran precisamente titánicas para lo que el modelo prometía —una marca, un formulario, un objeto 3D, cinco diapositivas— y ya alcanzaban para dejarme afuera. Quería subir la dificultad y, al mismo tiempo, empezaba a hacer la cuenta de cuánto margen me quedaba para intentarlo.
Eso también me cambió la forma de pensar la utilidad. Para un formulario que conozco de memoria y resuelvo rápido, delegar y esperar se siente un poco absurdo. Para una tarea de Blender que me exigiría aprender una herramienta entera desde cero, esa misma espera es una ganga. En mi caso el valor no dependió tanto de lo que el modelo podía hacer, sino de qué tan lejos estaba el trabajo de lo que yo ya sabía hacer.
Prueba 5: la moto que quería tener en el escritorio
Hasta acá todo había sido bastante amable. Un logotipo, un formulario, un isotipo extruido, una presentación. Tareas que, con tiempo y paciencia, cualquiera de nosotros resuelve. Faltaba lo otro: darle algo difícil de verdad, en un terreno donde sus propios creadores decían que el modelo se lucía. Modelado 3D.
Y yo tenía el candidato perfecto esperando hace rato. Quiero imprimir una maqueta de mi motocicleta para tenerla en el escritorio. El problema es que no es un modelo muy común: no hay diseños dando vueltas listos para mandar a la impresora, así que la única forma de conseguirla es que alguien la modele. Hasta ahora ese alguien no existía.
Armé el pedido con todo lo que tenía. Más de veinte imágenes de referencia desde distintos ángulos, un video dando la vuelta completa alrededor de la moto y un prompt detallado. Si el problema anterior había sido que mis instrucciones eran menos precisas que mis expectativas, esta vez no iba a poder quejarme de la falta de material.
Después dejé la tarea corriendo. Horas. Agoté la ventana de cinco horas varias veces y seguí gracias a los reseteos gratuitos que OpenAI había repartido entre los suscriptores por las complicaciones del lanzamiento de GPT-6. Nunca imaginé que ese regalo lo iba a gastar entero en una sola moto.

Tiene dos ruedas. Tiene tanque, manubrio, motor y hasta espejos. Y ahí terminan las coincidencias con la moto que le mostré en veinte fotos y un video. Como objeto genérico se defiende; como réplica de la mía, no. Y como archivo para mandar a la impresora, directamente no.
Mi opinión técnica, después de horas de espera y varios cupos quemados, se resume mejor en una imagen que en un párrafo.

Ahora, justicia para el acusado: por más horrible que esté, ese modelo es más de lo que yo podría haber hecho. Yo no sé modelar. Si me sentaba a hacerlo a mano, no había maqueta, no había render y probablemente no había ni una esfera bien puesta. Astra al menos me entregó algo, y ese algo salió de veinte fotos y un pedido en castellano.
También es probable que el problema no sea el techo del modelo sino el mío: con mucho más tiempo de ejecución, muchas más iteraciones y correcciones finas, seguramente se pueda llegar a algo mucho más parecido a la moto real. El detalle es que ese camino me agotaría la reserva bancaria de mi billetera, la de mi familia y algún ahorro de los vecinos. En algún punto, la maqueta sale más cara que la moto.
Por eso no lo cuento como un fracaso del modelo a secas: no hice una evaluación controlada ni agoté las estrategias posibles. Lo cuento porque es la diferencia más honesta que encontré en todas las pruebas. En las tareas medianas, Astra me sorprendió. En la primera tarea realmente difícil, la que justificaba tolerar la espera y quemar el cupo, se quedó bastante lejos de lo que necesitaba.
Mi moto, por ahora, sigue sin existir en el escritorio.
¿Y esto es AGI?
La pregunta vino de fábrica con el modelo. Hubo titulares anunciando que la era de la AGI ya había empezado, y no salieron de la nada: OpenAI reportó un 98,6% en ARC-AGI-3, un benchmark diseñado justamente para que un modelo no pueda resolverlo tirando de memoria, sino descubriendo por su cuenta las reglas de un entorno que nunca vio. Seis meses antes, su antecesor sacaba 7,8%. El salto es real y es enorme.
Pero después está la letra chica, que es donde siempre me gusta meterme. ARC Prize evaluó el mismo modelo con su harness estándar, el andamiaje neutral que le entregan igual a todos los proveedores, y ahí Astra sacó 62,7%. El casi 100% aparece con un harness específico, armado a medida para el modelo, con conversación continua y compactación de contexto propia. Y miles de dólares por partida.
Traducido a algo que se entienda sin leer papers: le pidieron a Astra que aprendiera a andar en bicicleta. Solo, con la bici que usan todos, anduvo más o menos. Después le pusieron rueditas hechas a medida, un casco, un manubrio ergonómico y alguien corriendo al lado, y ahí sí dio la vuelta al barrio mejor que cualquiera. Andar, anduvo. La pregunta es de quién es el mérito.
Los propios organizadores decidieron separar los dos resultados en la tabla con un argumento que me parece la frase más importante de todo el debate: el diseño de las herramientas y del contexto forma parte del sistema que se está midiendo. No es un detalle de implementación, es parte de lo que estás puntuando. Y algo parecido pasa cuando mirás índices independientes: en el agregado de Artificial Analysis, Astra queda prácticamente empatado con su propio antecesor.
¿Mi opinión, después de cinco pruebas en mi notebook? No, no es AGI. Al menos no lo fue en nada de lo que le pedí. Es una herramienta extraordinaria en un rango de tareas amplísimo, y en varias me dejó con la boca abierta. Pero cuando le puse enfrente el único problema realmente difícil, con veinte fotos, un video y horas de ejecución, no llegó. Probablemente con muchísimo más tiempo, más iteraciones y un andamiaje armado a medida se pueda llegar a algo que se le parezca bastante. El detalle es que ese andamiaje cuesta miles de dólares la partida, y no me parece que la inteligencia general se compre por unidad.
Para la próxima quiero medir lo que esta vez solo intuí: cuánto tarda, cuánta atención me roba mientras trabaja y cuánto trabajo útil queda cuando termina. Porque el criterio que me quedó no es "qué tan bueno es el modelo", sino algo bastante más aburrido y bastante más práctico: qué tan lejos está la tarea de lo que yo ya sé hacer, y cuánto estoy dispuesto a esperar por esa distancia.
Silvaren empezó como una excusa para probar un modelo y terminó siendo una marca con logotipo, perfil de desarrollador, render y presentación. La moto sigue sin existir. Yo me quedé con expectativas bastante menos cinematográficas y con preguntas bastante más útiles, que para un dev log me parece un saldo más que razonable. La próxima vez que le entregue una tarea, voy a mirar mucho menos el cursor y mucho más lo que deja hecho cuando se apaga.
Este artículo lo empecé a los codazos, lo editó GPT-6 Astra defendiéndose de casi todas mis acusaciones y lo terminó Claude poniendo orden. La moto sigue sin existir.