Mis modelos de IA favoritos a día de hoy

Modelos de IA favoritos en 2026, uno por tarea: Grok 4.7, GPT-6 Sol, GPT Image 2.5, Eleven Music 2.5, Seedance 2.5, GLM-OCR, Mistral OCR, Cartesia Sonic 3.6, Whisper, Parakeet, Firecrawl y Qwen 3.8 27B.

8 min leer

Carlos C.

Publicado el

Síguenos en Google

El stack de modelos de IA favoritos, a 24 de septiembre de 2026, no es un solo modelo. Cada tarea tiene uno: código, escritura, imagen, música, vídeo, OCR, voz, transcripción, scraping e IA local. Abajo está la tabla y el motivo de cada elección. No es un ranking de laboratorio. Es el que usamos cuando hay que entregar.

Tarea Modelo
Código Grok 4.7
Escritura GPT-6 Sol
Imagen GPT Image 2.5
Música Eleven Music 2.5
Vídeo Seedance 2.5
OCR GLM-OCR / Mistral OCR
Voz Cartesia Sonic 3.6
Transcripción Whisper + Parakeet
Scraping Firecrawl
IA local Qwen 3.8 27B Uncensored

Resumen

  • Código: Grok 4.7 (SpaceXAI), agente largo en el editor. API desde 2 $ / 6 $ por millón de tokens.
  • Escritura: GPT-6 Sol (gpt-6-sol). Más barato que Astra y suficiente para prosa.
  • Imagen: GPT Image 2.5. Flare si importa la velocidad; Sunburst si importa el retoque.
  • Música y vídeo: Music v2.5 y Seedance 2.5, los dos en el entorno de ElevenLabs.
  • OCR: GLM-OCR (0,9B, barato) o Mistral OCR si el documento es el trabajo, no un extra.
  • Voz y transcripción: Cartesia Sonic 3.6 para hablar; Whisper y Parakeet para oír.
  • Datos de la web: Firecrawl. Sin nube: Qwen 3.8 27B en local.

Código → Grok 4.7

Grok 4.7 es el modelo de código de este stack. SpaceXAI lo publicó el 21 de septiembre de 2026 como el más capaz de la serie para programación y trabajo de oficina: aguanta tareas largas, revisa su propio resultado y entiende el harness de Grok Bot. En CursorBench 4.0 (tareas largas de sesiones reales) marca 46,3 % en esfuerzo xhigh. La ventana es de 500.000 tokens. El precio de partida es 2 $ de entrada y 6 $ de salida por millón de tokens, el mismo techo de precio que Grok 4.6, con una variante rápida al doble.

No sustituye a un flagship de escritura. Para un PR, un bug que cruza varios archivos o un agente dentro de Cursor, es el que dejamos puesto.

Ficha: anuncio de Grok 4.7 y model card.

Escritura → GPT-6 Sol

GPT-6 Sol (gpt-6-sol) es el modelo de texto. OpenAI lo entrena con métodos cercanos a GPT-6 Astra, con otra ficha de precio y de contexto. En la API la ventana llega a 1.050.000 tokens de contexto y 128.000 de salida; el esfuerzo de razonamiento va de none a max. Astra sigue siendo el techo para ciencia y uso de ordenador; Sol es el que escribe correos, guías, propuestas y landings sin pagar tarifa de flagship.

Si el texto tiene que citar una cifra, la cifra sale de la fuente, no del modelo. Sol redacta. La fuente la pones tú. Guía hermana: GPT-6 Astra.

Imagen → GPT Image 2.5

GPT Image 2.5 salió el 8 de septiembre de 2026. En ChatGPT es Images 2.5. En la API hay dos IDs:

  • gpt-image-2.5-flare: el rápido. OpenAI lo da como calidad por encima de GPT Image 2 con menos latencia.
  • gpt-image-2.5-sunburst: el de precisión, para campaña o producto, con más tiempo de generación.

Los dos aceptan texto e imagen, editan, y permiten calidad low…max. El tamaño llega a 4K (3840×2160). Para una carátula o un anuncio, Flare primero. Sunburst solo cuando el retoque fino se nota.

Fuente: ChatGPT Images 2.5.

Música → Eleven Music 2.5

Eleven Music v2.5 es el modelo de música por defecto en ElevenMusic desde el 11 de septiembre de 2026, en generación por prompt y por referencia. El salto que describen es de capas: melodía, instrumentos y profundidad, con Music v2 todavía disponible. Los derechos del tema creado en ElevenMusic se quedan en quien lo genera; el detalle comercial depende del plan. Las descargas se bloquean si la pista referencia la canción de otro artista.

No es una voz cantada de locución. Es la pista. La locución va en Sonic.

Fuente: Music v2.5.

Vídeo → Seedance 2.5

Seedance 2.5 es el modelo de vídeo de ByteDance dentro de ElevenLabs. Genera clips de narrativa larga, hasta unos 30 segundos en un pase, con imágenes o vídeos de referencia (personaje, producto, plano) y edición por región: cambias un detalle sin regenerar el plano entero. Hace falta plan de pago. ElevenLabs indica que, por el proveedor en China, no está disponible para usuarios en Estados Unidos.

Seedance 2.0, en la misma estantería, mezcla vídeo y audio en un pase. 2.5 entra en este stack cuando el plano tiene que durar y poder corregirse por zonas. La música del anuncio, si hace falta aparte, sale de Music 2.5.

Fuente: Seedance 2.5 en ElevenLabs.

OCR → GLM-OCR / Mistral OCR

Dos herramientas, no una. El documento manda.

GLM-OCR (Zhipu / Z.AI) es un modelo de OCR de 0,9B parámetros. En OmniDocBench v1.5 publican 94,6 y un precio de API de 0,03 $ por millón de tokens de entrada y de salida. Cabe en un servidor pequeño (vLLM o SGLang) o se llama por API (glm-ocr). Encaja en facturas, tablas y layouts cuando el volumen es alto y el coste tiene que ser bajo.

Mistral OCR es la API de documentos de Mistral. En comparativas ciegas de comunidad (OCR Arena, septiembre de 2026) la v3 gana a GLM-OCR con frecuencia. Si el PDF es el entregable —contrato, informe, tabla rara— y no quieres operar el modelo, Mistral OCR. Si quieres barato, local o mucho volumen, GLM-OCR.

Fuente GLM-OCR: guía de Z.AI.

Voz → Cartesia Sonic 3.6

Cartesia Sonic 3.6 es el modelo de texto a voz. Sonic está hecho para agentes: latencia baja (la ficha pública de Sonic habla de menos de 90 ms), lectura del tono del texto, risa y pausas en la transcripción, clon de voz con unos 10 segundos y localización. La web de Cartesia cuenta 44 idiomas.

En un agente telefónico el modelo de lenguaje decide qué decir. Sonic decide cómo suena. No es lo mismo que transcribir. Para el sistema completo de una pyme, la pieza de negocio está en agentes de voz; Sonic es la capa de audio de este stack.

Fuente: Cartesia Sonic.

Transcripción → Whisper + Parakeet

Whisper (OpenAI, pesos abiertos) sigue siendo el modelo de transcripción polivalente: muchos idiomas, audio sucio, nombres propios a medias. Parakeet es la familia de ASR abierta de NVIDIA (NeMo). En este stack van juntos: Parakeet cuando la llamada es rápida y el idioma entra en su cobertura; Whisper cuando el audio es raro, mixto o hay que no perder el idioma. Ninguno sustituye al otro. El primero recorta tiempo. El segundo recorta sorpresas.

Scraping → Firecrawl

Firecrawl convierte una web en markdown limpio para el modelo. Sirve cuando el stack de arriba necesita la página real —precios, docs, una ficha— y no un resumen alucinado del buscador. La guía de instalación en Claude Desktop ya está escrita: cómo usar Firecrawl en Claude Desktop.

IA local → Qwen 3.8 27B Uncensored

Qwen 3.8 27B es el denso de visión y texto de Alibaba para esta talla: QwenCloud lo describe como mejora de código y trabajo de oficina sobre el 3.6-27B, en texto y en imagen. 27B cabe en una GPU de puesto de trabajo. No hace falta un clúster.

La variante Uncensored de este stack es un peso de comunidad, no el checkpoint oficial alineado de la API. Sirve en local cuando el modelo hospedado corta un borrador legítimo (código, ficción, redacción directa) y quieres seguir en tu máquina. No quita la ley ni el criterio: lo clínico, lo jurídico y lo que no debes publicar sigue fuera. No publiques datos de clientes en un peso que no controlas de punta a punta.

Ficha del modelo base: QwenCloud, qwen3.8-27b.

Cómo encaja el stack

Un anuncio corto, en orden: Firecrawl o el brief traen el dato, GPT-6 Sol escribe el guion, GPT Image 2.5 hace el fotograma, Seedance 2.5 lo mueve, Eleven Music 2.5 pone la pista, Cartesia Sonic 3.6 pone la voz, Whisper o Parakeet revisan lo grabado. El código que lo une, si es un agente, va con Grok 4.7. Si el portátil no puede llamar a la API, Qwen 3.8 27B en local.

Cambiará. Esta página es el corte del 24 de septiembre de 2026. Cuando cambie un puesto, se actualiza la fila, no el método: un modelo por tarea, con fuente.

Preguntas frecuentes

¿Por qué no un solo modelo para todo?

Porque el mejor de código no es el mejor de imagen, ni el de OCR, ni el de voz. Un flagship de texto cobra tarifa de flagship para un trabajo que un especialista cierra más barato.

¿GPT-6 Sol sustituye a GPT-6 Astra?

No. Astra es el techo de ciencia y de uso de ordenador. Sol es el de escritura y de agentes a otro precio. Los dos pueden convivir.

¿GLM-OCR o Mistral OCR?

GLM-OCR si quieres 0,9B, API barata o servidor propio. Mistral OCR si el documento es delicado y prefieres no operar el modelo.

¿Whisper o Parakeet?

Los dos. Parakeet para velocidad en los idiomas que cubre. Whisper cuando el audio o el idioma se sale de eso.

Artículos relacionados