Le 1er juillet 2026, OpenAI a officiellement ouvert la disponibilité générale de GPT-5.6 — non plus sous la forme d'un modèle unique, mais via trois lignes de produit nommées Sol, Terra et Luna. Si vous routez du trafic production aujourd'hui sans distinction de tier, le mauvais choix se traduit en quelques heures par une facture gonflée ou une latence insupportable. Ce guide décrypte chaque tier, expose trois risques de déploiement, propose une matrice de décision et une SOP en six étapes — pour que vous puissiez A/B tester les trois variantes sur un hardware isolé avant de verrouiller vos règles de routage.
GA du 1er juillet : ce que Sol, Terra et Luna représentent réellement
GPT-5.6 n'est plus un modèle monolithique. OpenAI a scindé la stack en trois SKU calibrés pour des profils de compute distincts — tous partageant la reconstruction d'alignement de juillet, mais différant en contexte, latence et tarification.
- Sol (
gpt-5.6-sol) : orienté vitesse. Contexte 128K, ~180 ms time-to-first-token, optimisé pour l'interface chat et la classification haute fréquence. Tier input le moins cher. - Terra (
gpt-5.6-terra) : tier production par défaut. Contexte 512K, latence équilibrée (~320 ms TTFT), tool-calling natif et sortie structurée. Remplace GPT-5.5 comme défaut API recommandé. - Luna (
gpt-5.6-luna) : tier raisonnement et long contexte. Fenêtre 1,5M tokens, ~680 ms TTFT, meilleurs scores SWE-Agent et monorepo. Coût par token le plus élevé.
Les utilisateurs ChatGPT Plus voient Terra par défaut ; Luna se débloque pour Pro et Enterprise ; Sol alimente le chat Free et le routage vocal Realtime API 2.0. Les clients API doivent définir explicitement la chaîne modèle — il n'existe pas encore de routage automatique.
Trois risques de rollout lors du choix d'un tier
Les équipes qui ont orienté chaque endpoint vers Luna le jour J ont vu leurs factures tripler. Celles qui ont routé des boucles Agent vers Sol ont heurté la troncature de contexte à 128K. Évitez les deux écueils.
1. Dérive du modèle par défaut dans les clients SDK
openai-python ≥1.42 conserve encore gpt-5.5 par défaut si vous ne surchargez pas. Un fallback silencieux signifie que vos benchmarks Terra n'atteignent jamais la production. Épinglez gpt-5.6-terra explicitement dans chaque config client avant le verrouillage de schéma du 3 juillet.
2. Coût Luna sur prompts courts
Luna input tourne à ~14 USD/1M tokens vs Sol à 4 USD/1M. Un pipeline de classification mal routé vers Luna paie 3,5× par requête sans gain qualitatif sur les prompts sous 2K tokens. Ajoutez des garde-fous de longueur token dans votre routeur.
3. Plafond de contexte Sol sur les boucles Agent
Les agents multi-étapes qui accumulent des résultats d'outils dépassent silencieusement la fenêtre 128K de Sol — OpenAI tronque depuis la tête, non la queue. Les harness Agent exigent Terra minimum ; réservez Luna pour les runs dépassant 400K tokens accumulés.
Matrice de décision : Sol vs Terra vs Luna
Utilisez ce tableau pour assigner les workloads — et non choisir un seul gagnant. Les chiffres reflètent la tarification GA list du 1er juillet 2026 et les fiches benchmark partenaires.
| Tier | Contexte | TTFT (p50) | $/1M Input | Cas d'usage idéal | À éviter quand |
|---|---|---|---|---|---|
| Sol | 128K | ~180 ms | 4 USD | Chat UI, classification, voix Realtime | Boucles Agent >50 tool calls |
| Terra | 512K | ~320 ms | 8 USD | RAG, copilote quotidien, agents production | Refactors full-repo >500K tokens |
| Luna | 1,5M | ~680 ms | 14 USD | Runs codage longs, analyse doc juridique | Prompts courts haute fréquence |
| GPT-5.5 (legacy) | 400K | ~290 ms | 7 USD | Fallback pendant migration | Nouvelles features post-1er juillet |
« Benchmark SWE-Agent (notes de release du 1er juillet) : Luna atteint 68,4 % vs Terra 61,2 % vs Sol 52,1 %. Sol domine sur la latence HumanEval à 1,8× plus rapide en médiane que Luna sur prompts identiques. »
Routage par rôle : qui reçoit quel tier
La plupart des équipes ont besoin d'un mix — non d'une seule chaîne modèle. Cartographiez les rôles avant d'écrire du code.
| Workload | Tier recommandé | Justification |
|---|---|---|
| Chatbot support client | Sol | TTFT sub-200 ms préserve le naturel conversationnel |
| RAG interne Confluence/Notion | Terra | 512K couvre les jeux de docs typiques ; tool calls stables |
| Agent codage autonome (multi-fichiers) | Luna | 1,5M contexte survit aux sessions refactor longues |
| Résumé batch (<8K tokens/doc) | Sol | Coût le plus bas par document à l'échelle |
| Revue compliance (PDF 100+ pages) | Luna | Document entier en un passage, sans assemblage de chunks |
SOP en six étapes pour sélectionner le tier
Exécutez chaque étape sur un hardware dédié. Attachez les fiches score à votre checklist release avant de basculer le routage production.
- Exporter l'histogramme trafic 30 jours. Regroupez les requêtes par longueur input token. >90 % sous 4K tokens → candidat Sol ; >200K → candidat Luna.
- Construire un golden set 25 prompts. Couvrez codage, RAG, refus, tool calls et troncature edge-case. Pondérez selon le mix trafic réel.
- Épingler SDK et chaînes modèle. Verrouillez openai-python ≥1.42. Définissez explicitement
gpt-5.6-sol,gpt-5.6-terra,gpt-5.6-lunaen config — ne comptez jamais sur les défauts bibliothèque. - A/B parallèle des trois tiers. Frappez chaque endpoint depuis un nœud isolé avec timestamps identiques. Jamais depuis un portable quotidien.
- Modéliser le coût au QPS production. Multipliez les comptages token golden-set par les tarifs GA juillet. Rejetez les routes Luna où le delta qualité Terra est <5 %.
- Soak test 72 heures avec failover tier. Simulez la promotion Sol→Terra quand le contexte dépasse 100K. Journalisez les événements promotion pour audit facturation.
Faits citables (1er juillet 2026)
- Date GA GPT-5.6 : 1er juillet 2026 — trois tiers (Sol, Terra, Luna) remplacent le modèle unique preview du 30 juin.
- Tarif Sol : 4 USD/1M input, 16 USD/1M output ; contexte 128K ; backend vocal par défaut Realtime API 2.0.
- Tarif Terra : 8 USD/1M input, 32 USD/1M output ; contexte 512K ; défaut API recommandé selon changelog OpenAI.
- Tarif Luna : 14 USD/1M input, 56 USD/1M output ; contexte 1,5M ; score SWE-Agent 68,4 % (tier le plus élevé).
- Sunset GPT-5.5 : accès API maintenu jusqu'au Q4 2026 ; pas de parité feature après le 1er juillet.
- Mac mini M4 clustervps : nœud dédié, 24 Go mémoire unifiée, repli Ollama, SSH + VNC, à partir de 107,9 USD/mois — sprint A/B Sol/Terra/Luna idéal.
Synthèse : benchmarker les trois, puis louer le nœud qui le prouve
Le lancement GPT-5.6 de juillet est un problème de routage, non de modèle. Sol gagne sur vitesse et coût. Terra est votre défaut production. Luna mérite sa prime uniquement sur le travail Agent long contexte. Les équipes qui évitent le choc facture sont celles qui terminent un golden-set A/B sur Apple Silicon isolé avant la clôture de la première facture production.
Parcours recommandé : louez un Mac mini M4 clustervps, connectez-vous en SSH, épinglez vos trois chaînes modèle et exécutez la SOP six étapes cette semaine — facturation mensuelle signifie que vous résiliez quand votre fiche score tier est complète, non quand le hardware se déprécie.
Prochaine étape : ouvrez la page d'achat, sélectionnez un nœud proche de votre région API, et lancez votre sprint comparatif Sol/Terra/Luna dès aujourd'hui.
Quelle est la différence entre GPT-5.6 Sol, Terra et Luna ?
Sol est le tier optimisé vitesse (128K contexte, ~180 ms TTFT, 4 USD/1M input). Terra est le tier équilibré par défaut (512K contexte, 8 USD/1M input, idéal pour RAG et agents quotidiens). Luna est le tier raisonnement long contexte (1,5M tokens, 14 USD/1M input, meilleur pour les runs Agent multi-heures). Les trois partagent la stack d'alignement GPT-5.6 publiée le 1er juillet 2026.
Quel tier GPT-5.6 choisir en juillet 2026 ?
Routez le chat et la classification vers Sol, le RAG production et les agents tool-calling vers Terra, les jobs de codage multi-heures ou l'analyse documentaire vers Luna. Exécutez un golden-set A/B sur les trois depuis un nœud Mac mini M4 cloud isolé avant de verrouiller les règles de routage.
Comparez Sol, Terra & Luna sur Mac mini M4
Épinglez les chaînes modèle, exécutez les benchmarks golden-set et modélisez les coûts GA juillet
Facturation mensuelle à partir de 107,9 USD — résiliez quand votre fiche score tier est complète