Tout ce que vous vouliez savoir sur la création d'une configuration d'IA bon marché (qui fonctionne toujours) mais que vous aviez peur de demander Rédigé par Christopher Penn via la sous-pile "Almost Timely News", j'ai élaboré un nouveau cours pour Trust Insights, AI for…
J’ai élaboré un nouveau cours pour Trust Insights, AI for Writing (and Writers), qui sortira le 25 août, et au cours du processus de création de ce cours, j’ai réalisé que je n’avais jamais mis en place un système d’IA agentique à prix réduit.
Depuis un certain temps déjà, beaucoup d’entre nous qui travaillent en « entreprise » ont accès à ce qui semble être une quantité illimitée d’IA (même si ce tour gratuit touche à sa fin dans les magasins d’entreprise en raison de factures absurdement élevées). Pour la personne moyenne qui n’a pas le soutien d’une entreprise, comment pourrions-nous exploiter la puissance des systèmes agents sans puiser dans nos portefeuilles ?
Cela revient à une question de Leslie du groupe Analytics for Marketers Slack :
« Avez-vous réalisé une vidéo ou publié un article contenant des recommandations pour une configuration d’un deuxième ordinateur bon marché que quelqu’un peut utiliser pour construire sa machine d’IA distincte ? »
Si vous travaillez dans une entreprise, veuillez vérifier auprès du service informatique avant d’installer un logiciel bon gré mal gré. En tant qu’ancien professionnel de l’informatique, nous vous remercions.
Deuxièmement, dans ce numéro, je parlerai des modèles d’IA fabriqués en Chine comme Qwen et DeepSeek. Il existe une ÉNORME différence entre un modèle chinois hébergé par une entreprise en République populaire de Chine (RPC) et un modèle fabriqué en Chine hébergé par une entreprise en dehors de la RPC.
Il est manifestement dangereux d’utiliser des modèles d’IA hébergés en RPC pour tout type d’informations confidentielles, point final. Tout à fait bien d’utiliser ces modèles pour des choses qui sont entièrement publiques, comme les demandes de recherche.
Cependant, il est totalement sûr d’utiliser des modèles d’IA fabriqués en Chine sur votre propre matériel ou dans une infrastructure digne de confiance. Il existe de très nombreux excellents fournisseurs d’inférence qui proposent des éléments tels que l’hébergement Zero Data Retention (ZDR) qui sont encore plus sûrs à utiliser que les modèles Big Tech, car les fournisseurs garantissent qu’ils ne conservent pas du tout vos données. (La plupart des fournisseurs de Big Tech ont une clause « nous conservons vos données pendant 30 jours pour éviter les abus » dans leurs conditions d’utilisation)
Il existe actuellement de nombreuses craintes concernant les modèles de pondération ouverts (y compris ceux chinois) car les bénéfices des fournisseurs de grandes technologies sont en jeu si ces modèles continuent d’offrir la parité des capacités à une fraction du coût. Ne croyez pas le battage médiatique ; Les modèles de pondérations ouvertes sont si sûrs que des entreprises comme HuggingFace les ont utilisés pour mettre en place leurs propres défenses de cybersécurité.
Troisièmement, lorsque j’ai des relations commerciales, je les divulguerai. J’ai un lien d’affiliation Amazon dans l’article de cette semaine et je travaille évidemment pour mon entreprise, Trust Insights. Je n’ai aucun intérêt financier dans les autres sociétés mentionnées au moment de la rédaction de cet article. (mais je suis heureux de pouvoir m’appeler)
Nous commencerons notre visite par quel modèle utiliser. En général, vous souhaitez des modèles qui allient rentabilité et performances efficaces. L’un de mes sites préférés à ce sujet est Artificial Analysis ; il y a une jolie petite grille sur leur page de modèles qui montre le coût par rapport à l’intelligence. Ce que nous recherchons dans cette grille, ce sont les modèles qui se trouvent dans le coin supérieur gauche : l’axe vertical (y) représente le cerveau, où plus haut est meilleur, et l’axe horizontal (x) représente le coût, où à gauche est plus bas.
Le gagnant actuel ici est DeepSeek V4 Flash 0731, qui a un prix incroyablement bas et beaucoup de cerveaux, à égalité avec le dernier modèle d’OpenAI, GPT-5.6 Luna. À l’extrême droite se trouve Claude Opus 5, qui possède environ 15 % de cerveaux en plus mais 40 fois plus cher. Le pire quadrant dans lequel se trouver est celui en bas à droite : coût élevé, cerveaux faibles.
Dans le but de créer le système agent le moins cher, DeepSeek sera votre modèle de pilote quotidien.
Maintenant, il convient de souligner, comme je l’ai fait dans mon livre Almost Timeless: 48 Foundation Principles of Generative AI, qu’un conducteur quotidien n’est peut-être pas le modèle le plus intelligent, mais en termes de travail quotidien, un modèle comme DeepSeek v4 Flash fera le travail la plupart du temps. Au fait, voici une petite rétrospective mettant DeepSeek à la même échelle que tous les modèles majeurs d’OpenAI au fil des années pour voir où il se situe en termes de cerveaux.
DeepSeek V4 Flash surpasse toutes les versions des modèles OpenAI, sauf les plus récentes, au fil des ans ; il est près de 50 % plus intelligent que le modèle phare de l’été dernier, le GPT-5, et n’est que 17 % moins performant que le modèle phare actuel d’OpenAI.
DeepSeek V4 Flash est à peu près à parité avec Claude Opus 4.7 – sorti en avril 2026, IL Y A À peine QUATRE MOIS.
Maintenant, les temps changent, la technologie change, et ce que vous devriez faire est de vérifier ce type de graphiques au fil du temps pour voir quel modèle est le plus proche de ce coin supérieur gauche. Ce mois-ci, c’est DeepSeek V4 Flash. Le mois prochain, ce sera peut-être complètement différent. Il est de notre responsabilité de suivre les classements et d’utiliser les cerveaux les moins chers et les meilleurs que nous puissions trouver.
Maintenant que nous savons quel modèle nous envisageons d’utiliser, nous devons déterminer où l’utiliser.
Tout comme les sociétés d’hébergement Web hébergent des sites Web, les sociétés d’hébergement de modèles – appelées fournisseurs d’inférence – hébergent des modèles. Il y en a tellement, et ils se font concurrence principalement sur deux points : la vitesse et le prix. Certains fournisseurs facturent un supplément mais génèrent des résultats (jetons par seconde) à des vitesses ridicules, comme Cerebras. D’autres proposent une grande variété de modèles à des vitesses plus lentes mais sont bon marché (comme DeepInfra).
Le choix d’un fournisseur est simple : comme vous avez déjà décidé du modèle, c’est une question de prix et de disponibilité. En mode Google AI, modifiez cette invite en fonction de vos besoins :
Aidez-moi à créer une liste de fournisseurs d’inférences qui correspondent à ces critères. Tout d’abord et surtout, ils DOIVENT proposer ce modèle exact : {model}. Ceci est immuable et non négociable ; un fournisseur qui ne propose pas ce modèle ne figure pas sur la liste. Deuxièmement, identifiez la tarification de ce modèle en trois catégories : coût par jeton d’entrée, coût par jeton de sortie, coût par jeton mis en cache. Si un fournisseur ne propose pas de tarification pour ce modèle pour les jetons mis en cache, disqualifiez-le. Troisièmement, le fournisseur DOIT être un fournisseur d’inférences à rétention de données nulle (ZDR). Si le prix du ZDR est supplémentaire, calculez-le dans le cadre des coûts des jetons. La capacité ZDR est obligatoire ; si un fournisseur n’offre pas de ZDR, disqualifiez-le. Quatrièmement, si disponible, obtenez les jetons par seconde pour ce modèle pour chaque fournisseur. Renvoyez vos résultats sous forme de liste ordonnée par ordre croissant par coût par jeton le plus bas pour chaque fournisseur pour notre modèle choisi.
Vous souhaiterez peut-être ajouter des besoins supplémentaires spécifiques tels que la conformité SOC 2, la conformité RGPD, etc. À l’invite en fonction de vos besoins, personnalisez-la comme vous le souhaitez.
Quel que soit le modèle que vous choisissez, assurez-vous de saisir le nom complet du modèle ; DeepSeek v4 Flash, par exemple, a un antécédent dépourvu du suffixe 0731. Notre modèle exact que nous voulons est DeepSeek v4 Flash 0731.
Lorsque je colle cela dans Google, DeepInfra, Fireworks AI et OpenCode Zen apparaissent comme de bonnes options. Celui que vous choisirez dépendra de la priorité que vous accorderez à la vitesse par rapport au coût. Si vous m’avez dit d’en choisir un et un seul, je suis client de DeepInfra depuis quelques années maintenant et je n’ai rien à redire, MAIS il y a aussi des arguments à faire valoir en faveur d’OpenCode Zen. Nous en reparlerons dans une minute.
Ce que j’aime, pour le cas d’utilisation spécifique de Leslie, c’est que les fournisseurs payants signifient que vous ne payez pas si vous n’utilisez pas l’IA ET qu’il existe une forte incitation économique pour que vous utilisiez l’IA le moins possible et que vous soyez aussi efficace que possible dans son utilisation. L’un des problèmes avec les forfaits de jetons (qui incluent des éléments comme Claude Pro/Max, etc.) est que si vous n’avez pas atteint vos limites hebdomadaires/mensuelles, vous gaspillez de l’argent – et vous êtes donc plus susceptible d’utiliser l’IA de manière frivole. Avec le paiement au fur et à mesure, vous ne payez que ce que vous utilisez.
Pour une deuxième configuration informatique bon marché, nous devons réfléchir au fonctionnement des ordinateurs. L’interface utilisateur graphique à laquelle nous sommes tous habitués sur Windows ou Mac ou même sur Linux de bureau, ainsi que sur nos téléphones et tablettes, est un gaspillage de ressources de calcul INCROYABLEMENT inefficace. Il faut d’énormes quantités de mémoire et de puissance de traitement pour dessiner et maintenir l’interface par rapport aux interfaces purement textuelles.
Maintenant, le vieux nerd informatique GenX en moi dit que tout le monde devrait savoir comment utiliser une interface textuelle (souvent appelée ligne de commande, invite de commande ou terminal), mais ce n’est pas réaliste. Cependant, il y a un utilisateur qui ADORE les interfaces textuelles.
Ouais, vous l’avez deviné. C’est l’IA. L’IA est bien plus efficace pour taper qu’avec une souris, donc pour notre deuxième ordinateur, comme Leslie l’a demandé, nous allons viser une boîte très bon marché qui peut faire fonctionner un terminal, stocker des objets et faire fonctionner un harnais d’IA. À un prix d’environ 500 USD, vous n’exécuterez pas de modèles d’IA directement sur ce matériel (d’où la raison pour laquelle nous avons recherché des fournisseurs d’hébergement dans la partie 2), mais vous disposerez d’une machine décente avec un bon stockage.
Dans le magasin de votre choix, recherchez ce qu’on appelle des mini-PC de jeu. Ceux-ci auront généralement des puces AMD Ryzen, un petit disque dur (généralement un SSD de 256 Go ou 512 Go) et entre 16 Go et 32 Go de RAM. La règle cardinale de l’informatique est que vous voulez autant de RAM/mémoire que l’argent peut en acheter ; un processeur légèrement plus lent avec plus de RAM vaut mieux qu’un processeur rapide avec pas assez de RAM. La RAM est comme les voies d’autoroute ; une Bugatti coincée dans la circulation sur un chemin de terre à une seule voie n’ira pas aussi vite qu’une Prius sur une autoroute à 8 voies sans embouteillage.
Le mode Google AI est également pratique ici. Modifiez cette invite en fonction de vos besoins, surtout s’il existe des entreprises avec lesquelles vous préféreriez ne pas faire affaire :
[…] La suite de l’article est à lire sur ZeroHedge via le lien ci-dessous.
Traduit automatiquement de l’anglais. Le texte original fait foi.
Source : ZeroHedge — Lire l’article original
