Summer '26 a livré les tests A/B natifs pour les thèmes et les configurations de checkout. Évaluation d'ingénieur : où cela retire un outil de votre stack, où cela ne suffit pas, et comment éviter d'en tirer de fausses conclusions.
Les tests A/B natifs sont arrivés sur Shopify en juin 2026, sous Rollouts dans la section Markets. Ils couvrent les thèmes et les configurations de checkout, avec planification et publication progressive intégrées. Pour un grand nombre de marchands, c'est la première fois que le test fractionné est accessible sans rien installer.
C'est réellement significatif, et c'est aussi là que se situe le risque. La barrière à l'entrée pour lancer un test vient de tomber à presque zéro. La barrière pour lancer un test qui veut dire quelque chose n'a pas bougé.
Trois capacités, à distinguer avec précision.
Test fractionné de thèmes. Servir deux versions de thème à un partage du trafic. C'est la fonction phare et celle qui retire un outil tiers aux boutiques qui ne testaient que la mise en page.
Test de configurations de checkout. Tester des configurations de checkout en split, ce qui compte beaucoup maintenant que Checkout Components est généralement disponible sur Plus. Comparer un checkout composé à l'existant était auparavant laborieux. C'est désormais natif.
Publication progressive. Diffuser un changement à une part croissante du trafic plutôt qu'à tout le monde d'un coup. Techniquement, il s'agit d'une sécurité de déploiement plus que d'une expérimentation, mais c'est sans doute la plus utile des trois, car elle transforme une mise en production risquée en manœuvre réversible.
Si vous ne retenez qu'une chose de Rollouts, retenez la publication progressive plutôt que le test. Déployer un changement de thème sur cinq pour cent du trafic, surveiller les erreurs et la conversion pendant quelques heures, puis élargir, évite une catégorie d'incidents bien plus coûteuse que le gain de n'importe quel test.
Rollouts ne remplace pas une plateforme d'expérimentation. Les manques qui comptent :
Un outil natif qui rend les tests faciles à lancer ne les rend pas faciles à interpréter. Deux modes d'échec vont être extrêmement répandus l'année prochaine.
Arrêter quand le chiffre est bon. Les écarts de taux de conversion oscillent énormément dans les premiers jours d'un test. Si vous regardez tous les jours et arrêtez dès que la variante B passe devant, vous déclarerez des gagnants qui ne sont que du bruit. La règle d'arrêt doit être fixée avant le lancement, en taille d'échantillon et en durée, puis respectée.
Tester des changements trop petits pour être détectés. La plupart des boutiques n'ont pas le trafic nécessaire pour détecter un gain relatif de un pour cent dans un délai raisonnable. Avant tout lancement, calculez le plus petit effet réellement détectable compte tenu de votre trafic et de votre taux de conversion de base. Si ce chiffre est de quinze pour cent en relatif, tester une couleur de bouton revient à gaspiller quatre semaines.
Un calcul de dimensionnement approximatif, à faire avant chaque test :
// Taille d'échantillon approximative par variante, test bilatéral, confiance 95%, puissance 80%.
// baseline : taux de conversion actuel, par exemple 0.024
// mde : effet minimal détectable en gain relatif, par exemple 0.10 pour 10%
function samplePerVariant(baseline, mde) {
const p1 = baseline;
const p2 = baseline * (1 + mde);
const pBar = (p1 + p2) / 2;
const zAlpha = 1.96;
const zBeta = 0.84;
const numerator =
Math.pow(zAlpha * Math.sqrt(2 * pBar * (1 - pBar)) +
zBeta * Math.sqrt(p1 * (1 - p1) + p2 * (1 - p2)), 2);
return Math.ceil(numerator / Math.pow(p2 - p1, 2));
}
const perVariant = samplePerVariant(0.024, 0.10);
const weeklySessions = 40000;
const weeks = (perVariant * 2) / weeklySessions;
console.log({ perVariant, weeks: Math.ceil(weeks * 10) / 10 });Exécutez-le avec vos vrais chiffres. Pour une boutique à deux virgule quatre pour cent de conversion et quarante mille sessions hebdomadaires, détecter un gain relatif de dix pour cent prend plusieurs semaines. Ce n'est pas une raison de renoncer aux tests. C'est une raison de tester des choses assez grandes pour compter et d'arrêter de programmer quatre expériences par mois.
Faites tourner au moins une semaine complète, deux de préférence, quel que soit le résultat du calcul d'échantillon. Les comportements d'achat en semaine et le week-end diffèrent assez pour qu'un test terminé un jeudi mesure surtout le jour de la semaine.
Compte tenu des tailles d'effet réellement détectables, les candidats qui passent la barre sont structurels plutôt que cosmétiques.
| Test | Taille d'effet typique | Ça vaut le coup ? |
|---|---|---|
| Restructuration de la fiche produit | Moyenne à forte | Oui |
| Checkout composé contre checkout existant | Potentiellement forte | Oui, et désormais supporté nativement |
| Ajout ou suppression d'une étape de checkout | Forte | Oui |
| Filtres et tri par défaut des pages collection | Moyenne | Oui, pour les gros catalogues |
| Variation d'image ou de titre de hero | Faible | Rarement, sauf trafic très élevé |
| Couleur de bouton ou microcopie | Très faible | Non |
L'autre sujet qui mérite d'être testé, et que presque personne ne teste, c'est la performance. Une page plus rapide n'est pas un changement de mise en page, elle n'apparaîtra donc pas dans un backlog de tests classique, mais la relation entre temps de chargement et conversion est l'un des effets les plus fiables du e-commerce. Nous avons rassemblé les données dans notre analyse Core Web Vitals et conversion, et la démarche de diagnostic dans notre checklist d'audit Core Web Vitals Shopify.
Une mise en garde propre aux tests natifs. Rollouts rapporte la mesure faite par Shopify du split. Si votre stack analytique affiche des chiffres différents, et ce sera le cas, résistez à la tentation de retenir la source qui confirme le résultat souhaité.
Décidez avant le test quelle source fait foi, et assurez-vous qu'elle ne soit pas purement côté client. Bloqueurs de publicités, choix de consentement et restrictions navigateur suppriment une part significative et non aléatoire des événements client, ce qui suffit à inverser un résultat serré. Notre guide du tracking côté serveur couvre la mise en place, et si vous voulez que les résultats d'expérience côtoient le reste de vos données commerciales plutôt qu'un tableau de bord isolé, notre guide Looker Studio et BigQuery traite le volet entrepôt.
Rollouts est une vraie amélioration, surtout parce que la publication progressive sécurise le déploiement de thèmes et parce que le test de configuration de checkout arrive exactement au moment où les boutiques Plus en ont besoin. Il ne remplace pas une plateforme d'expérimentation pour le test de prix, les storefronts headless ou les expériences segmentées.
Le changement le plus important est culturel. Quand les tests étaient coûteux à mettre en place, la barre pour en lancer un était haute. Maintenant qu'ils sont gratuits, la discipline doit venir d'ailleurs : une hypothèse écrite, un calcul de dimensionnement et une règle d'arrêt avant toute mise en ligne.
Nous aidons les équipes à construire des programmes d'expérimentation qui produisent des décisions plutôt que des tableaux de bord, mesure côté serveur et reporting entrepôt inclus. Voir notre service d'analyse de données et BI.
Le partage de thème non, puisqu'il n'y a pas de thème rendu par Shopify à partager. Le test de configuration de checkout reste applicable. Les expériences storefront doivent tourner dans votre propre couche de rendu.
Non. Il partage des thèmes et des configurations de checkout. Le test de prix et d'offres exige toujours un outil dédié.
Assez longtemps pour atteindre la taille d'échantillon qu'impose votre taux de conversion de base, et jamais moins d'une semaine complète. Deux semaines est un défaut plus sûr, car les comportements de semaine et de week-end y sont couverts deux fois.
Uniquement si vous l'utilisiez exclusivement pour des tests de mise en page de thème. Si vous faites de la segmentation, du test de prix ou des expériences côté serveur, la fonction native ne vous couvre pas.
L'arrêt prématuré. La facilité de consultation quotidienne rend très tentant de déclarer un gagnant dès qu'il apparaît, et c'est ainsi que du bruit se retrouve mis en production comme une découverte.

Le business case des Core Web Vitals pour les sites ecommerce, en chiffres. Impact réel sur la conversion mesuré chez Vodafone, NDTV, Carpe, Rakuten et 30 autres cas. Ce que 100 ms de LCP vous coûtent réellement par mois.

Le Black Friday est dans treize semaines. Voici le travail technique à réaliser avant le gel de code, séquencé pour que rien n'atterrisse dans la semaine où tout se joue.

Summer '26 a activé le Universal Commerce Protocol sur toutes les boutiques Shopify et ajouté une section Agentic à l'admin. Vos produits sont déjà exposés aux agents d'achat IA. Voici comment auditer ce qu'ils voient vraiment.