Six exigences qu'un site web ordinaire ne formule jamais. Lisez-les avant de comparer les formules, car ce sont elles qui distinguent un projet d'IA qui tient la route d'un projet bridé par son propre hébergement.
Les bibliothèques d'IA cassent au moindre changement de version mineure. Une mise à jour du tokenizer ou du SDK client peut modifier vos résultats du jour au lendemain. Vous devez choisir la version de l'interpréteur et figer le jeu de dépendances, et non hériter de ce avec quoi le serveur a été reconstruit la semaine dernière.
Vectoriser un ensemble de documents, réindexer après un téléversement, relancer une génération qui a échoué : rien de tout cela ne tient dans une requête de navigateur. Cela relève d'un worker qui continue de tourner après que le visiteur a fermé l'onglet, ce qui est un besoin d'hébergement très différent.
La recherche documentaire a besoin d'un index. Ce peut être pgvector dans Postgres, un fichier SQLite, ou un moteur dédié comme Qdrant, Weaviate ou Milvus. Chacun réclame de la mémoire et des lectures aléatoires soutenues, et la réponse honnête sur celui qui conviendra dépend du nombre de documents que vous découpez en fragments.
Une API de modèle qui répond en huit secondes, c'est normal, ce n'est pas une panne. Votre serveur web, votre délai d'expiration PHP ou Node, votre proxy et votre navigateur ne sont pas du tout d'accord sur ce point. Mettre d'accord les délais d'expiration, les relances et les réglages keep-alive représente l'essentiel du travail pour livrer une fonctionnalité d'IA.
Le streaming token par token signifie qu'un visiteur occupe une connexion pendant toute la durée de la réponse. Dix personnes qui discutent en même temps, ce sont dix connexions simultanées qui ne font presque rien, c'est-à-dire exactement le schéma que les limites de concurrence de l'hébergement mutualisé sont faites pour bloquer.
Une clé d'API de modèle placée dans le JavaScript front end, c'est une facture que quelqu'un d'autre peut faire grimper. Les clés doivent résider dans un fichier situé hors de la racine web, ou dans un fichier d'environnement que le serveur refuse de servir, chaque appel passant par votre propre back end afin que vous puissiez en limiter le débit et le journaliser.
Aucun hébergeur ne peut proposer toutes les colonnes ci-dessous sur une formule d'entrée de gamme. Classer d'abord vos composants dans ces trois catégories vous évitera une migration plus tard.
| Fonctionne bien sur un hébergement mutualisé cPanel | Nécessite un VPS cloud avec accès root | Nécessite un GPU ou une API de modèle |
|---|---|---|
|
|
|
Les trois problèmes techniques à l'origine de presque tous les tickets d'assistance que nous recevons des équipes qui hébergent des applications d'IA.
Un dispositif de recherche documentaire comporte quatre éléments mobiles : une tâche d'ingestion qui découpe vos documents sources en fragments, un appel d'embedding qui transforme chaque fragment en vecteur, un magasin qui conserve ces vecteurs, et un chemin de requête qui récupère les correspondances les plus proches et les transmet au modèle. Trois de ces quatre éléments coûtent peu. L'ingestion est celui qui fait mal, parce qu'elle arrive par à-coups, qu'elle peut durer des heures et qu'elle sollicite fortement le stockage pendant son exécution. Construisez-la comme une tâche que vous pouvez démarrer, arrêter et reprendre depuis un shell plutôt que comme quelque chose que déclenche une requête web, et le reste de la stack devient de l'hébergement web ordinaire. Les équipes qui construisent le même schéma avec des outils visuels associent généralement cette page à nos formules d'automatisation n8n infogérées, où le moteur de workflow est lui-même le processus de longue durée.
Une génération qui prend douze secondes sera interrompue par au moins un élément situé entre votre code et le visiteur, à moins que vous n'alliez le modifier. PHP a une limite de temps d'exécution des scripts. LiteSpeed a son propre délai d'expiration de connexion. Cloudflare, qui se place devant chaque site ElySpace, ferme une requête qui ne produit aucun octet pendant trop longtemps. La solution n'est pas d'augmenter le délai d'expiration partout : c'est d'envoyer les premiers octets tôt, ou d'accepter la requête, de la confier à un worker et de laisser le navigateur interroger ou s'abonner pour obtenir le résultat. Décidez lequel de ces deux schémas vous utilisez avant de choisir une formule, car le streaming maintient une connexion, contrairement à l'interrogation périodique.
ElySpace publie les plafonds de son hébergement mutualisé au lieu de les dissimuler, et pour des travaux liés à l'IA les chiffres comptent davantage que le discours marketing. Les formules d'entrée de gamme sont limitées par CloudLinux aux valeurs ci-dessous, et les règles qui suivent relèvent de la politique de la maison, pas de la préférence. Si votre conception se heurte à l'une d'elles, c'est vers un VPS cloud qu'il faut vous tourner, et il est moins coûteux de l'apprendre maintenant qu'après une suspension.
Le texte complet, y compris les clauses relatives aux applications de messagerie instantanée et aux robots d'exploration, figure dans nos limites de ressources de l'hébergement mutualisé. Lisez en particulier les clauses sur le chat et les robots si vous envisagez un bot d'assistance ou un crawler d'ingestion, car tous deux y sont nommément cités et tous deux ont vocation à vivre dans un environnement dédié.
Quatre étapes, dans l'ordre qui évite de refaire le travail. La première est celle que l'on saute, et c'est celle qui détermine tout le reste.
Placez chaque composant de votre application dans l'une des trois colonnes ci-dessus. La colonne la plus lourde détermine l'offre.
Un projet uniquement front-end convient à l'hébergement mutualisé. Tout ce qui est résident, conteneurisé ou en streaming démarre sur un VPS cloud.
Poussez via Git, figez les versions de vos dépendances, placez les clés dans un fichier que le serveur ne servira pas, et planifiez les tâches.
cPanel affiche en direct votre utilisation du CPU, de la mémoire et des processus d'entrée. Montez en gamme avant que la courbe ne vienne s'aplatir contre le plafond.
Un GPU n'est nécessaire que si les poids du modèle se trouvent sur votre propre machine. Si vous appelez un modèle hébergé via une API, toutes les opérations lourdes sur les tenseurs se déroulent dans le centre de données de quelqu'un d'autre, et votre serveur se contente de manipuler des chaînes de caractères, d'analyser du JSON et d'écrire en base de données. C'est du travail pour le CPU, et quelques cœurs virtuels suffisent largement. Là où les équipes sont réellement bloquées, ce n'est pas sur la puissance de calcul, c'est sur les droits : elles doivent lancer un démon, ouvrir un port, installer un paquet système ou maintenir un processus en vie, et aucun compte mutualisé nulle part ne le leur permettra. C'est pourquoi la véritable voie d'évolution pour un projet d'AI est un serveur cloud évolutif ou une formule VPS avec accès root plutôt que du matériel exotique. Si votre projet a réellement besoin de configurations accélérées par GPU, elles ne font pas partie des formules ElySpace publiées : parlez-en à notre équipe en nous expliquant ce que vous cherchez à exécuter, et nous vous dirons honnêtement si nous pouvons vous aider.
Envoyez-nous la structure de votre stack : le framework, l'API de modèle que vous appelez, si quelque chose doit rester résident en mémoire, et approximativement combien de documents vous indexez. Nous vous dirons quelle formule ElySpace convient et, tout aussi utilement, quand ce n'est pas le cas. Le chat en direct et les tickets sont ouverts 24h/24 et 7j/7, et la migration gratuite s'applique si vous déplacez une application AI en service depuis un autre hébergeur. Chaque formule est couverte par l'engagement de disponibilité de 99.9% défini dans notre contrat de niveau de service, et fonctionne sur LiteSpeed Enterprise, CloudLinux, cPanel, Imunify360, JetBackup et un stockage NVMe SSD. Si vous préférez commencer par les fondamentaux, notre présentation de l'hébergement cPanel couvre la plateforme mutualisée, tandis que les formules avec cœurs dédiés conviennent à un front end déjà très sollicité.
C'en est probablement assez de notre part, nous laisserons nos clients parler à notre place : avec plus de 2000 avis sur Trustpilot et Facebook, constatez par vous-même pourquoi vous pouvez nous confier la puissance de votre site web.