GPT-6 Sol i Luna vs GPT-5.6: millors models a gairebé meitat de preu

GPT-6 Sol i Luna milloren en codi, factualitat i treball agentic mentre redueixen aproximadament a la meitat els preus de l'API.

L'últim llançament d'OpenAI té una particularitat bastant poc habitual: GPT-6 Sol i GPT-6 Luna no només són més capaços que els seus equivalents GPT-5.6, sinó que també són molt més barats.

A mi aquesta combinació m'interessa bastant més que un altre model guanyant dos punts en un benchmark. Amb agents de codi, el límit cada vegada és menys si poden resoldre una tasca i més quanta iteració sostinguda et pots permetre abans que el cost o els límits d'ús condicionin com treballes.

Ja he començat a fer servir GPT-6 Sol amb reasoning mitjà a Codex. La primera sensació és que pot assumir canvis relativament grossos sense enfonsar immediatament el pressupost d'ús. Encara és massa aviat per convertir això en una conclusió, i les quotes de Codex no equivalen directament al preu per tokens de l'API, però la direcció es nota.

El canvi més evident: aproximadament la meitat de preu

OpenAI explica que les millores d'inferència i memòria cau li permeten reduir un 50% el preu de Sol i Luna respecte als preus promocionals de GPT-5.6.

El titular és bastant clar: GPT-6 no només millora en capacitat, sinó que el preu de l'API es mou fortament en la direcció contrària.

Model Entrada / 1M tokens Sortida / 1M tokens
GPT-5.6 Sol 4,00 $ 20,00 $
GPT-6 Sol 2,00 $↓ 50% 10,00 $↓ 50%
GPT-5.6 Luna 0,20 $ 1,20 $
GPT-6 Luna 0,10 $↓ 50% 0,50 $↓ 58%
En Sol la reducció és exactament del 50% tant en entrada com en sortida. En Luna l'entrada també cau un 50%, però la sortida passa d'1,20 $ a 0,50 $, aproximadament un 58% menys.

Això és el que pot canviar decisions d'arquitectura. Un model més barat és útil. Un model millor és útil. Un model que millora mentre baixa clarament de preu pot convertir en opció per defecte càrregues que abans costava justificar.

GPT-6 Sol vs GPT-5.6 Sol

OpenAI posiciona GPT-6 Sol com el model per a desenvolupament complex i fluxos agentics, amb una finestra de context d'1,05 milions de tokens i fins a 128.000 tokens de sortida. Admet nivells de reasoning des de none fins a max.

Les millores no es concentren en una sola prova. OpenAI reporta avenços en treball professional, fiabilitat factual, codi i ús de l'ordinador. En la seva avaluació interna de factualitat, GPT-6 Sol comet aproximadament la meitat d'errors que GPT-5.6 Sol. En FrontierCode i DeepSWE també millora de forma clara en tasques de software sobre repositoris reals.

La part interessant no és que ara tots els resultats siguin perfectes. És que la corba de capacitat sembla anar cap amunt mentre el preu per token va justament cap avall.

GPT-6 Luna potser és el model més interessant

Sol és el daily driver obvi per a feina exigent, però Luna pot acabar sent el llançament més disruptiu.

GPT-6 Luna costa 0,10 $ per milió de tokens d'entrada i 0,50 $ per milió de sortida, mantenint la mateixa finestra d'1,05M i els mateixos 128K de sortida màxima que Sol. OpenAI el descriu com el seu model més eficient per a tasques enfocades i d'alt volum.

I en alguns casos la distància de capacitat s'està fent sorprenentment petita. OpenAI afirma que Luna amb reasoning alt millora GPT-5.6 Luna en 5,4 punts percentuals a AutomationBench mentre costa un 58% menys per tasca. A OSWorld, GPT-6 Luna en max pot superar GPT-5.6 Sol en medium a aproximadament una desena part del cost.

Això fa que Luna sigui interessant per coses que fins ara hauria enviat gairebé automàticament a un model més gran: classificació amb context, canvis repetitius de codi, extracció estructurada, agents amb moltes eines, tests, migracions i automatitzacions en segon pla.

El preu per token no és el mateix que el cost per tasca

Aquest és probablement el matís més important.

Que un model costi un 50% menys per token no implica que cada sessió de Codex duri exactament el doble. El nivell de reasoning canvia el consum, les eines afegeixen treball, les tasques llargues poden arrossegar molt més context i les quotes de subscripció de Codex no són una còpia directa de la facturació pública de l'API.

Això encaixa bastant amb el que estic veient. Puc llençar una tasca important amb GPT-6 Sol Medium i veure una baixada relativament petita del meu ús disponible, però no necessàriament exactament la meitat del que hauria esperat amb GPT-5.6. També pot ser que el model estigui fent més feina útil dins d'aquest mateix consum.

Per això cada vegada em sembla més útil mirar el cost per tasca acabada que no pas el cost per token.

La memòria cau importa més quan treballes amb agents

GPT-6 també introdueix millores de prompt caching. OpenAI indica que les lectures d'entrada ja cachejades tenen un descompte del 90% i que el sistema nou intenta conservar més context reutilitzable fins i tot quan canvies el reasoning o les eines disponibles.

Per un prompt puntual està bé. Per un agent és molt més rellevant. Els agents de codi reenvien constantment parts grans del mateix repositori, instruccions, definicions d'eines i historial de conversa. Si més context entra per cache, hi ha menys contingut que s'ha de processar de zero a cada torn.

És una d'aquelles millores que queda menys espectacular en una captura de benchmark, però pot tenir molt impacte quan un agent està treballant durant hores.

Quin faria servir jo?

  • GPT-6 Sol: com a opció per defecte per desenvolupament seriós, arquitectura, debugging i feina agentic on un mal raonament surt car.
  • GPT-6 Luna: per volum alt, implementació repetitiva, extracció, classificació, agents de fons i tasques on el cost escala més ràpid que la complexitat.
  • GPT-6 Astra: per aquelles tasques on realment vull el model més capaç i el sobrecost està justificat.

La part que vull provar durant les pròximes setmanes és fins a quin punt Luna pot substituir Sol sense convertir-se en el coll d'ampolla. Si aquesta frontera s'ha mogut gaire, l'estalvi real pot ser bastant més gran que el simple titular del 50%.

La història important és l'eficiència, no el número 6

Durant una època, cada generació nova significava sobretot més capacitat a canvi de més còmput. Aquest llançament és més interessant perquè capacitat i cost es mouen en direccions oposades.

GPT-6 Sol és més barat que GPT-5.6 Sol. GPT-6 Luna és més barat que GPT-5.6 Luna. Tots dos són més capaços. El caching millora. I els models estan clarament pensats per càrregues agentic sostingudes, no només per respondre un xat puntual.

Per qui utilitza Codex cada dia, em sembla més important això que una altra posició en un leaderboard.

Prefereixo un model que em deixi tenir un agent treballant més estona, iterar més i acabar més feina real amb el mateix pressupost que no pas un que guanyi un benchmark per dos punts i costi el doble.

Fonts: OpenAI — Introducing GPT-6 Sol and Luna, OpenAI API pricing i catàleg de models d'OpenAI. Preus i disponibilitat comprovats el 24 de setembre de 2026.

MÉS COSES

Segueixo
escrivint.

Veure el blog →