Le 1er juillet 2026, OpenAI a officiellement ouvert la disponibilité générale de GPT-5.6 — non plus sous la forme d'un modèle unique, mais via trois lignes de produit nommées Sol, Terra et Luna. Si vous routez du trafic production aujourd'hui sans distinction de tier, le mauvais choix se traduit en quelques heures par une facture gonflée ou une latence insupportable. Ce guide décrypte chaque tier, expose trois risques de déploiement, propose une matrice de décision et une SOP en six étapes — pour que vous puissiez A/B tester les trois variantes sur un hardware isolé avant de verrouiller vos règles de routage.

GA du 1er juillet : ce que Sol, Terra et Luna représentent réellement

GPT-5.6 n'est plus un modèle monolithique. OpenAI a scindé la stack en trois SKU calibrés pour des profils de compute distincts — tous partageant la reconstruction d'alignement de juillet, mais différant en contexte, latence et tarification.

  • Sol (gpt-5.6-sol) : orienté vitesse. Contexte 128K, ~180 ms time-to-first-token, optimisé pour l'interface chat et la classification haute fréquence. Tier input le moins cher.
  • Terra (gpt-5.6-terra) : tier production par défaut. Contexte 512K, latence équilibrée (~320 ms TTFT), tool-calling natif et sortie structurée. Remplace GPT-5.5 comme défaut API recommandé.
  • Luna (gpt-5.6-luna) : tier raisonnement et long contexte. Fenêtre 1,5M tokens, ~680 ms TTFT, meilleurs scores SWE-Agent et monorepo. Coût par token le plus élevé.

Les utilisateurs ChatGPT Plus voient Terra par défaut ; Luna se débloque pour Pro et Enterprise ; Sol alimente le chat Free et le routage vocal Realtime API 2.0. Les clients API doivent définir explicitement la chaîne modèle — il n'existe pas encore de routage automatique.

Trois risques de rollout lors du choix d'un tier

Les équipes qui ont orienté chaque endpoint vers Luna le jour J ont vu leurs factures tripler. Celles qui ont routé des boucles Agent vers Sol ont heurté la troncature de contexte à 128K. Évitez les deux écueils.

1. Dérive du modèle par défaut dans les clients SDK

openai-python ≥1.42 conserve encore gpt-5.5 par défaut si vous ne surchargez pas. Un fallback silencieux signifie que vos benchmarks Terra n'atteignent jamais la production. Épinglez gpt-5.6-terra explicitement dans chaque config client avant le verrouillage de schéma du 3 juillet.

2. Coût Luna sur prompts courts

Luna input tourne à ~14 USD/1M tokens vs Sol à 4 USD/1M. Un pipeline de classification mal routé vers Luna paie 3,5× par requête sans gain qualitatif sur les prompts sous 2K tokens. Ajoutez des garde-fous de longueur token dans votre routeur.

3. Plafond de contexte Sol sur les boucles Agent

Les agents multi-étapes qui accumulent des résultats d'outils dépassent silencieusement la fenêtre 128K de Sol — OpenAI tronque depuis la tête, non la queue. Les harness Agent exigent Terra minimum ; réservez Luna pour les runs dépassant 400K tokens accumulés.

Matrice de décision : Sol vs Terra vs Luna

Utilisez ce tableau pour assigner les workloads — et non choisir un seul gagnant. Les chiffres reflètent la tarification GA list du 1er juillet 2026 et les fiches benchmark partenaires.

Tier Contexte TTFT (p50) $/1M Input Cas d'usage idéal À éviter quand
Sol 128K ~180 ms 4 USD Chat UI, classification, voix Realtime Boucles Agent >50 tool calls
Terra 512K ~320 ms 8 USD RAG, copilote quotidien, agents production Refactors full-repo >500K tokens
Luna 1,5M ~680 ms 14 USD Runs codage longs, analyse doc juridique Prompts courts haute fréquence
GPT-5.5 (legacy) 400K ~290 ms 7 USD Fallback pendant migration Nouvelles features post-1er juillet

« Benchmark SWE-Agent (notes de release du 1er juillet) : Luna atteint 68,4 % vs Terra 61,2 % vs Sol 52,1 %. Sol domine sur la latence HumanEval à 1,8× plus rapide en médiane que Luna sur prompts identiques. »

Routage par rôle : qui reçoit quel tier

La plupart des équipes ont besoin d'un mix — non d'une seule chaîne modèle. Cartographiez les rôles avant d'écrire du code.

Workload Tier recommandé Justification
Chatbot support client Sol TTFT sub-200 ms préserve le naturel conversationnel
RAG interne Confluence/Notion Terra 512K couvre les jeux de docs typiques ; tool calls stables
Agent codage autonome (multi-fichiers) Luna 1,5M contexte survit aux sessions refactor longues
Résumé batch (<8K tokens/doc) Sol Coût le plus bas par document à l'échelle
Revue compliance (PDF 100+ pages) Luna Document entier en un passage, sans assemblage de chunks

SOP en six étapes pour sélectionner le tier

Exécutez chaque étape sur un hardware dédié. Attachez les fiches score à votre checklist release avant de basculer le routage production.

  1. Exporter l'histogramme trafic 30 jours. Regroupez les requêtes par longueur input token. >90 % sous 4K tokens → candidat Sol ; >200K → candidat Luna.
  2. Construire un golden set 25 prompts. Couvrez codage, RAG, refus, tool calls et troncature edge-case. Pondérez selon le mix trafic réel.
  3. Épingler SDK et chaînes modèle. Verrouillez openai-python ≥1.42. Définissez explicitement gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna en config — ne comptez jamais sur les défauts bibliothèque.
  4. A/B parallèle des trois tiers. Frappez chaque endpoint depuis un nœud isolé avec timestamps identiques. Jamais depuis un portable quotidien.
  5. Modéliser le coût au QPS production. Multipliez les comptages token golden-set par les tarifs GA juillet. Rejetez les routes Luna où le delta qualité Terra est <5 %.
  6. Soak test 72 heures avec failover tier. Simulez la promotion Sol→Terra quand le contexte dépasse 100K. Journalisez les événements promotion pour audit facturation.

Faits citables (1er juillet 2026)

  • Date GA GPT-5.6 : 1er juillet 2026 — trois tiers (Sol, Terra, Luna) remplacent le modèle unique preview du 30 juin.
  • Tarif Sol : 4 USD/1M input, 16 USD/1M output ; contexte 128K ; backend vocal par défaut Realtime API 2.0.
  • Tarif Terra : 8 USD/1M input, 32 USD/1M output ; contexte 512K ; défaut API recommandé selon changelog OpenAI.
  • Tarif Luna : 14 USD/1M input, 56 USD/1M output ; contexte 1,5M ; score SWE-Agent 68,4 % (tier le plus élevé).
  • Sunset GPT-5.5 : accès API maintenu jusqu'au Q4 2026 ; pas de parité feature après le 1er juillet.
  • Mac mini M4 clustervps : nœud dédié, 24 Go mémoire unifiée, repli Ollama, SSH + VNC, à partir de 107,9 USD/mois — sprint A/B Sol/Terra/Luna idéal.

Synthèse : benchmarker les trois, puis louer le nœud qui le prouve

Le lancement GPT-5.6 de juillet est un problème de routage, non de modèle. Sol gagne sur vitesse et coût. Terra est votre défaut production. Luna mérite sa prime uniquement sur le travail Agent long contexte. Les équipes qui évitent le choc facture sont celles qui terminent un golden-set A/B sur Apple Silicon isolé avant la clôture de la première facture production.

Parcours recommandé : louez un Mac mini M4 clustervps, connectez-vous en SSH, épinglez vos trois chaînes modèle et exécutez la SOP six étapes cette semaine — facturation mensuelle signifie que vous résiliez quand votre fiche score tier est complète, non quand le hardware se déprécie.

Prochaine étape : ouvrez la page d'achat, sélectionnez un nœud proche de votre région API, et lancez votre sprint comparatif Sol/Terra/Luna dès aujourd'hui.

Quelle est la différence entre GPT-5.6 Sol, Terra et Luna ?

Sol est le tier optimisé vitesse (128K contexte, ~180 ms TTFT, 4 USD/1M input). Terra est le tier équilibré par défaut (512K contexte, 8 USD/1M input, idéal pour RAG et agents quotidiens). Luna est le tier raisonnement long contexte (1,5M tokens, 14 USD/1M input, meilleur pour les runs Agent multi-heures). Les trois partagent la stack d'alignement GPT-5.6 publiée le 1er juillet 2026.

Quel tier GPT-5.6 choisir en juillet 2026 ?

Routez le chat et la classification vers Sol, le RAG production et les agents tool-calling vers Terra, les jobs de codage multi-heures ou l'analyse documentaire vers Luna. Exécutez un golden-set A/B sur les trois depuis un nœud Mac mini M4 cloud isolé avant de verrouiller les règles de routage.

Fenêtre lancement GPT-5.6 →Feuille de route OpenAI juillet →Démarrage rapide SSH & VNC →
Lab A/B tiers GPT-5.6

Comparez Sol, Terra & Luna sur Mac mini M4

Épinglez les chaînes modèle, exécutez les benchmarks golden-set et modélisez les coûts GA juillet
Facturation mensuelle à partir de 107,9 USD — résiliez quand votre fiche score tier est complète

Démarrer le lab comparatif tiers Voir tarifs & nœuds Guide configuration SSH