SpaceXAI lanzó hoy Grok 4.6, un modelo de lenguaje grande que, según dice, puede superar a Claude Fable 5 de Anthropic PBC en algunas áreas.
SpaceXAI se conocía como xAI hasta el mes pasado. El proveedor de inteligencia artificial fundado por Elon Musk cambió de nombre en relación con su adquisición por parte de SpaceX Corp. En junio, la compañía combinada cotizó sus acciones en el Nasdaq a través de la mayor oferta pública inicial registrada.
Grok 4.6 se lanzará solo un mes después de que SpaceXAI lanzara su LLM insignia anterior. Según la empresa, una de las principales mejoras es que sus ingenieros dedicaron más tiempo a entrenar el modelo anterior. La ejecución de entrenamiento ampliada utilizó un conjunto de datos generado por IA diseñado para mejorar las capacidades de razonamiento de Grok 4.6. SpaceXAI también proporcionó al modelo acceso a “datos de ingeniería de alta calidad”.
La ejecución de capacitación inicial fue seguida por dos pasos de desarrollo adicionales. El primero utilizó un método de entrenamiento llamado ajuste fino supervisado, o SFT, mientras que el segundo utilizó aprendizaje por refuerzo.
Una ejecución de capacitación SFT refina el resultado de un LLM utilizando un conjunto de ejemplos de indicaciones y respuestas empaquetadas previamente. Los ingenieros utilizan principalmente la técnica para garantizar que las respuestas rápidas de LLM se generen en un formato fácil de usar. SpaceXAI utilizó Grok 4.5, el predecesor de Grok 4.6, para optimizar la fase de entrenamiento SFT de este último modelo. El flujo de trabajo de optimización se centró en mejorar su capacidad para abordar tareas científicas y de programación.
SpaceXAI evaluó Grok 4.6 utilizando el Índice de Inteligencia de Análisis Artificial. Es un conjunto de datos que combina nueve puntos de referencia de IA populares que abarcan campos como la ciencia, la codificación y los servicios financieros. Grok 4.6 obtuvo una puntuación de 61, lo que lo puso a la par con el modelo insignia GPT-5.6 Sol de OpenAI Group PBC y un punto detrás de Claude Fable 5.
La compañía también comparó los modelos en otros nueve puntos de referencia. Grok 4.5 logró superar a Claude Fable 5 en tres. Uno de los puntos de referencia, AA-Briefcase, evalúa la capacidad de los LLM para realizar proyectos de trabajo de conocimiento que tardarían semanas humanas en completarse. Las otras dos evaluaciones abarcaron tareas que abarcaban más de media docena de industrias.
Grok 4.5 es particularmente experto en generar prototipos de software basados en descripciones de alto nivel, según SpaceXAI. Además, es mejor que su predecesor a la hora de crear recursos visuales como interfaces. También es más probable que el modelo revise su trabajo en busca de errores cuando trabaja en proyectos a largo plazo.
La versión estándar de Grok 4.6 tiene un precio de $2 por millón de tokens de entrada y $6 por millón de tokens de salida. SpaceXAI también ofrece una edición más rápida que cuesta el doble. El LLM está disponible a través de Cursor, la plataforma de codificación vibe que la empresa compró por 60 mil millones de dólares en junio, y una herramienta de programación desarrollada internamente llamada Grok Build.