KAYTUS présente son service de gestion de l’IA pour les centres de données
Le service d’assistance sur site OEM de KAYTUS réduit de plus de 30 % le temps de rétablissement du matériel et permet d’effectuer les réparations en moins de quatre heures
SINGAPOUR, 29 sept. 2026 (GLOBE NEWSWIRE) -- KAYTUS a présenté aujourd’hui son service OEM AI Managed Service, qui fournit une maintenance matérielle et un support technique intégrés pour les centres de données d’IA (AIDC) et les clusters hyperscale. Le service associe le stockage local de composants de remplacement critiques, des capacités de diagnostic et de réparation de niveau usine et des ingénieurs de service sur site certifiés, afin d’effectuer des réparations matérielles complexes en quatre heures seulement. Les données issues des opérations sur le terrain de KAYTUS indiquent que ce modèle de prestation sur site réduit de plus de 30 % le temps de rétablissement du matériel par rapport aux niveaux de service généralement disponibles sur le marché, avec un délai moyen de résolution de bout en bout des incidents de 12 heures par nœud défaillant.
Ce lancement répond aux exigences opérationnelles de l’infrastructure d’IA, qui passe d’une phase de déploiement rapide à une phase de production durable et fiable. Gartner prévoit que les dépenses mondiales consacrées à l’IA atteindront 2 670 milliards de dollars en 2026, dont environ 1 480 milliards de dollars alloués aux infrastructures d’IA. À mesure que les clusters passent à l’échelle de milliers d’accélérateurs, les défaillances matérielles deviennent un défi opérationnel inhérent, faisant de la disponibilité des systèmes et du temps de rétablissement des indicateurs critiques des accords de niveau de service (SLA). La rationalisation de l’isolation des pannes, de la remédiation matérielle et du rétablissement des services contribue à préserver la capacité de calcul planifiable et à assurer la continuité des charges de travail.
1. Au-delà du déploiement : assurer la fiabilité opérationnelle.
Le rapport technique de Meta consacré à Llama 3.1 405B met en évidence les défis opérationnels liés à l’entraînement de modèles d’IA à grande échelle. Au cours de 54 jours de préentraînement sur un cluster de 16 384 GPU, le système a enregistré 419 interruptions imprévues, soit en moyenne une interruption toutes les trois heures. Environ 78 % d’entre elles étaient attribuables à des défaillances matérielles avérées ou présumées.
Une étude présentée lors du SOSP 2025 a documenté plus de 44 000 incidents sur plus de 778 000 tâches d’entraînement au cours de trois mois d’exploitation d’une plateforme de production à grande échelle destinée à l’entraînement de grands modèles de langage (LLM). Ces résultats soulignent l’importance d’une détection et d’un rétablissement rapides des pannes pour préserver la disponibilité des capacités de calcul et maintenir la capacité de production à mesure que les centres de données d’IA prennent de l’ampleur.
L’analyse des pannes publiée par l’Uptime Institute en 2026 a révélé que 57 % des répondants avaient déclaré des coûts supérieurs à 100 000 dollars pour leur dernière panne majeure, tandis qu’un répondant sur cinq faisait état de pertes supérieures à 1 million de dollars. Certains contrats de location de capacités de calcul prévoient une indemnisation pouvant atteindre 25 % des frais de location mensuels en cas de manquement majeur aux SLA. Pour les fournisseurs de capacités de calcul, les défaillances matérielles amplifient l’exposition financière en raison des pertes de revenus, des indemnisations contractuelles, de la poursuite de la dépréciation des actifs et des perturbations des opérations des clients.
Une stratégie de maintenance intelligente et efficace est donc essentielle aux opérations des centres de données d’IA. Le temps nécessaire au rétablissement du service influe directement sur la perte de capacité de calcul productive lors de chaque incident.
2. Les limites des modèles de maintenance traditionnels.
Les centres de données d’IA modernes fonctionnent avec des densités de puissance par rack supérieures à 40 kW, et intègrent étroitement les infrastructures de calcul, de réseau et de refroidissement. La défaillance d’un seul nœud peut perturber les charges de travail d’IA des clients. Ces conditions d’exploitation exigeantes, caractérisées par une infrastructure dense et une utilisation soutenue des ressources, mettent en évidence plusieurs limites des modèles de maintenance conventionnels :
- Délais prolongés d’approvisionnement en pièces de rechange : les centres de données d’IA déploient des matériels hétérogènes avec des spécifications et des configurations de composants variées. L’approvisionnement en pièces de remplacement critiques auprès d’entrepôts régionaux ou le transfert de stocks entre régions peut prolonger les délais de livraison jusqu’à plusieurs jours, retardant ainsi le rétablissement du matériel.
- Cycles de réparation en usine prolongés : les défaillances complexes des nœuds peuvent nécessiter un diagnostic et une réparation hors site dans une usine équipée d’outils spécialisés. Les délais liés au transport et aux files d’attente du service prolongent l’indisponibilité des nœuds, réduisant la capacité de calcul disponible et augmentant l’exposition aux manquements aux SLA.
-
Complexité accrue des diagnostics : les clusters d’IA intègrent des topologies réseau complexes, des infrastructures de calcul denses et des systèmes de refroidissement liquide ou à air. Les pannes couvrant plusieurs de ces domaines peuvent prolonger les diagnostics réalisés par les équipes opérationnelles conventionnelles, tandis que le support à distance seul ne peut remplacer entièrement une expertise spécialisée sur site.
Ensemble, ces contraintes de maintenance peuvent prolonger le rétablissement d’un nœud jusqu’à 48 heures ou davantage. Pour les infrastructures de calcul facturées à l’heure, une indisponibilité prolongée se traduit directement par une perte de revenus.
3. AI Managed Service : l’expertise OEM directement sur site.
KAYTUS AI Managed Service répond à ces lacunes en matière de maintenance en apportant directement aux centres de données d’IA et aux clusters de calcul hyperscale l’expertise d’ingénierie OEM, les infrastructures de réparation et les capacités d’intervention en cas d’incident. Fondé sur cinq composantes de service essentielles, ce modèle sur site offre des engagements de service mesurables et des délais de rétablissement plus prévisibles :
- Maintenance personnalisée tout au long du cycle de vie : KAYTUS évalue l’infrastructure et les exigences opérationnelles de chaque client afin de fournir une maintenance matérielle OEM adaptée tout au long du cycle de vie des équipements, aussi bien pour les déploiements standard que pour les environnements techniquement complexes.
- Stock de pièces de rechange critiques sur site : KAYTUS stocke les matériels de remplacement essentiels, notamment les nœuds de calcul, les commutateurs réseau et les cartes d’interface réseau (NIC) haut débit, au sein du centre de données du client. L’accès immédiat élimine les délais liés à l’expédition externe et permet d’effectuer les réparations matérielles en quatre heures seulement.
- Diagnostic et réparation OEM sur site : KAYTUS déploie directement sur les sites des clients des équipements de diagnostic de niveau usine et des outils de réparation spécialisés, permettant aux ingénieurs de diagnostiquer et de réparer des composants individuels ainsi que des nœuds complets sans retourner les systèmes en usine. Dans les déploiements clients, cette approche a permis de réduire à 12 heures le temps moyen de traitement d’un incident par nœud défaillant, depuis l’évaluation initiale jusqu’à l’achèvement de la réparation.
- Assistance technique certifiée 24 h/24, 7 j/7 : dans le cadre des niveaux de service applicables, des ingénieurs certifiés par l’OEM assurent une couverture continue 24 h/24 et 7 j/7 sur site, avec l’appui de spécialistes dédiés de niveau 2 qui interviennent en quelques minutes en cas d’incident imprévu.
-
Prédiction des défaillances assistée par l’IA et inspections proactives : des évaluations programmées de l’état des équipements et des technologies intelligentes de prédiction des défaillances utilisent l’IA pour détecter les premiers signes de dégradation du matériel, permettant une maintenance préventive avant toute interruption de service et réduisant la dépendance aux réparations réactives.
« La valeur d’un actif de calcul ne se définit pas par son ampleur au premier jour, mais par sa capacité à fournir de manière fiable une capacité de calcul heure après heure tout au long de son cycle de vie opérationnel. KAYTUS AI Managed Service transforme le rétablissement du matériel, qui était jusqu’ici un délai incertain, en un engagement de service mesurable. »
— Caesar, responsable des services, KAYTUS.
4. Des résultats éprouvés en production : réduction des temps d’arrêt et des risques liés aux SLA pour un fournisseur mondial de services cloud.
KAYTUS AI Managed Onsite Service a obtenu les résultats opérationnels suivants dans le centre de données d’IA d’un fournisseur mondial majeur de services cloud, prenant en charge plus de 100 racks et des milliers d’accélérateurs :
| Indicateur | Résultat |
| Temps moyen de traitement | Réduit de 48 heures à 12 heures par nœud défaillant |
| Temps de calcul productif | Augmentation de 50 %, principalement grâce à la réduction des temps d’arrêt et à l’accélération du rétablissement, ce qui a accru le temps d’exploitation productif pour les charges de travail d’entraînement et d’inférence. |
| Indemnisation au titre des SLA | La réduction des temps d’arrêt et la diminution du nombre de redémarrages des charges de travail ont réduit de plusieurs millions de dollars la responsabilité potentielle du client au titre des indemnisations liées aux SLA. |
AI Managed Service étend actuellement sa couverture à l’échelle mondiale, avec une présence dans plusieurs marchés européens clés, notamment au Royaume-Uni, en Allemagne, en France, aux Pays-Bas, en Finlande, en Pologne et en Islande, ainsi qu’au Japon et en Corée du Sud dans la région Asie-Pacifique. Les modèles de déploiement et les niveaux de service peuvent être adaptés à l’échelle de l’infrastructure et aux besoins opérationnels de chaque client. Les procédures de service sont conçues pour répondre aux obligations locales en matière de conformité, notamment aux exigences applicables du RGPD.
Les infrastructures d’IA modernes créent une valeur durable grâce à des performances soutenues et à un service fiable. KAYTUS AI Managed Service peut s’intégrer à la plateforme d’exploitation intelligente KSManage de KAYTUS, en combinant l’expertise OEM sur site avec une gestion des opérations alimentée par l’IA, afin d’améliorer la prévisibilité opérationnelle et de soutenir des niveaux de service mesurables pouvant être formalisés dans des engagements contractuels.
Pour en savoir plus : https://www.kaytus.com/about/contact/
À propos de KAYTUS
KAYTUS est un fournisseur de premier plan de solutions d’infrastructure pour l’intelligence artificielle et de technologies de refroidissement liquide. L’entreprise propose une large gamme de produits innovants, ouverts et respectueux de l’environnement destinés au cloud, à l’intelligence artificielle, à l’edge computing et à d’autres applications émergentes. Grâce à une approche centrée sur les besoins de ses clients, KAYTUS se distingue par sa capacité d’adaptation et la flexibilité de son modèle économique. Pour en savoir plus, rendez-vous sur KAYTUS.com ou suivez l’entreprise sur LinkedIn et X.
Contact médias : media@kaytus.com
Legal Disclaimer:
EIN Presswire provides this news content "as is" without warranty of any kind. We do not accept any responsibility or liability for the accuracy, content, images, videos, licenses, completeness, legality, or reliability of the information contained in this article. If you have any complaints or copyright issues related to this article, kindly contact the author above.