Réponse en bref
La chose la moins chère qu'un acheteur peut faire avant qu'un achat d'IA soit assemblé deux cents de leurs propres exemples avec des réponses connues. Presque personne ne le fait, et la démo décide à la place.
L'idée centrale: Celui qui fournit les exemples décide du résultat d'une…
Celui qui fournit les exemples décide du résultat d'une évaluation de l'IA. Si le fournisseur apporte les données de démonstration, l'approvisionnement a déjà été réglé avant la première réunion.
Les processus de sélection de l'IA sont généralement exécutés comme une séquence de démonstrations. Chaque fournisseur présente, chacun présente bien, et l'équipe d'achat est laissée en comparant les impressions des systèmes qui ont été montrés à leur meilleur sur le matériel choisi par le fournisseur. Tout le monde sait que c'est faible, et le remède habituel est un pilote rémunéré — qui est cher, lent et toujours marqué officieusement à la fin par les mêmes personnes qui ont regardé les démos.
Ce qui a changé, et pourquoi ça compte maintenant: La précision des scores sur l'ensemble retenu, le profil…
Le savoir est dans la façon dont une liste restreinte s'effondre. Les équipes qui ont organisé seules des démonstrations ont tendance à obtenir une préférence qu'elles trouvent difficile à articuler, et les raisons énoncées dérivent entre les réunions: il semblait plus poli, l'équipe semblait plus forte, la feuille de route était plus claire. Les équipes qui ont apporté leurs propres exemples décrivent leur choix en nombre et ne sont pas d'accord sur les pondérations plutôt que sur les impressions. Le second type de désaccord est productif; le premier est la façon dont les organisations finissent par conclure des contrats de trois ans qu'elles ne peuvent justifier dix-huit mois plus tard.
Construire le modèle d'exploitation: Échantillonner deux cents cas réels avec des résultats…
Assemblez un ensemble de vos propres cas avec des résultats exacts connus avant tout contact avec le fournisseur, et notez chaque démonstration contre elle dans les mêmes conditions.
Deux cents exemples sont généralement suffisants et réalisables dans une quinzaine. Échantillonnez-les dans la distribution que vous voyez plutôt que dans celle que vous décrivez : inclure la majorité de routine, les cas saisonniers de bord, les intrants malformés, et la poignée de personnes expérimentées argumentent. Ce dernier groupe est le plus précieux et le plus souvent omis, car c'est le groupe où l'organisation n'est pas d'accord. Etablir les bonnes réponses en interne d'abord, et enregistrer les désaccords — un cas sur lequel vos propres experts scindés ne peut pas être compté contre un fournisseur, mais il vous dit quelque chose de plus utile sur où le processus est ambigu.
Mesurer ce que la décision a produit: Les processus d'approvisionnement pour l'IA sont…
La précision des scores sur l'ensemble retenu, le profil d'erreur par catégorie, le coût par millier de cas à votre volume, et la latence à votre pic plutôt que la moyenne.
Le profil d'erreur est plus important que la précision globale, car les erreurs ne sont pas interchangeables. Un système à quatre-vingt-douze pour cent qui échoue au hasard est généralement meilleur qu'un système à quatre-vingt-quatorze qui échoue systématiquement dans une catégorie représentant un cinquième de vos revenus. Rapporter les performances par catégorie et refuser un seul nombre global. Sur le coût, modélisez votre distribution réelle, y compris les relevés et les entrées longues, puisque le prix unitaire coté sur une courte moyenne des entrées sous-estime la facture d'une large marge au volume de production.
Lorsque l'exécution cesse: La chose la moins chère qu'un acheteur peut faire avant…
Le principal risque est de construire l'ensemble à partir d'enregistrements historiques propres, qui produit un repère qui ne ressemble plus aux entrées mesquines que le système recevra réellement.
Le deuxième risque est la fuite de l'ensemble. Une fois que les exemples sont partagés avec un fournisseur pour un pilote, ils cessent d'être une mesure d'exclusion pour toute ronde ultérieure, et un renouvellement évalué sur eux mesure la mémorisation. Gardez une partition de réserve qui n'est jamais partagée avec personne, utilisez-la seulement lors du renouvellement, et traitez son existence comme confidentielle. Il s'agit d'une hygiène administrative peu glamour et c'est la différence entre une décision de renouvellement fondée sur la preuve et une décision fondée sur la familiarité du titulaire.
À quoi cela ressemble dans la pratique: La chose la moins chère qu'un acheteur peut faire avant…
Dans la pratique, l'exercice prend un analyste deux semaines et change complètement l'approvisionnement. Les fournisseurs sont envoyés les mêmes cent cas, les sorties de retour dans un format fixe, et sont marqués par quelqu'un qui n'a pas assisté aux démos. Les cent autres séjours en réserve. Les conversations qui suivent sont nettement différentes : les fournisseurs s'interrogent sur les catégories d'erreurs plutôt que sur la chronologie, et ceux qui s'engagent sérieusement avec une catégorie sur laquelle ils ont mal marqué sont généralement ceux qui méritent une présélection. Cela change aussi la conversation interne. Un comité d'approvisionnement qui a plaidé pendant des semaines au sujet de quel système se sent plus capable de résoudre l'argument dans un après-midi une fois que les mêmes cent cas ont été examinés, et le désaccord résiduel est sur combien une catégorie d'erreur particulière compte pour l'entreprise — c'est-à-dire une décision que le comité est en fait qualifié pour prendre, et celle sur laquelle il aurait dû consacrer son temps. Une prudence pratique : fixer le format de sortie avant d'envoyer quoi que ce soit. Les fournisseurs qui demandent des réponses en format libre retourneront chacun une forme différente, et la notation devient alors un exercice d'interprétation qui réintroduit exactement la subjectivité que l'ensemble a été construit pour supprimer. Un schéma court et un exemple travaillé suffit, et cela prend une heure.
L'argument le plus fort contre cette: Celui qui fournit les exemples décide du résultat d'une…
L'objection juste est qu'un ensemble retenu récompense la capacité que vous pouvez déjà mesurer et pénalise celui que vous ne pouvez pas. Les systèmes diffèrent de la façon dont un score de précision ne saisit pas — comment ils échouent, comment ils s'expliquent, comment ils se comportent sur des intrants contrairement à quoi que ce soit dans votre histoire — et un processus purement quantitatif peut sélectionner un produit optimisé par référence plutôt qu'un produit réellement meilleur.
Donc l'ensemble devrait décider de la liste restreinte, pas du gagnant. Utilisez-le pour éliminer les systèmes qui ne peuvent pas faire le travail, puis choisissez entre les survivants sur les critères qualitatifs que les scores ne peuvent atteindre : modèle de soutien, termes des données, coût de sortie, et si l'équipe répond directement aux questions difficiles. Ce que l'ensemble supprime, c'est la possibilité de choisir sur les impressions seules, ce qui est une revendication plus petite qu'elle ne semble et une amélioration beaucoup plus grande qu'elle ne sonne.
Une séquence de mise en œuvre de 30 jours: La précision des scores sur l'ensemble retenu, le profil…
Échantillonner deux cents cas réels avec des résultats connus cette quinzaine, les diviser en deux, et envoyer les cent premiers à chaque fournisseur sur la liste.
Les jours un à trois définissent les catégories et la base de sondage. Jours quatre à huit, tirer les cas et avoir deux personnes expérimentées les étiquettent indépendamment — le taux de désaccord est votre plafond pour tout vendeur. Jours 9 à 10, résoudre ou exclure les désaccords et geler l'ensemble. Jour 11, diviser et verrouiller la moitié de la réserve quelque part où l'équipe d'approvisionnement ne peut pas accéder occasionnellement. Jour 12 à partir de, courir chaque fournisseur à travers la même centaine dans le même format, marqué aveugle.
Garder la réserve à moitié réservée
Enregistrer qui a accès à la partition de réserve et quand elle a été utilisée pour la dernière fois. L'échec est rarement délibéré: quelqu'un a besoin d'une vérification rapide de la santé avant un renouvellement, tire l'ensemble le plus proche disponible, et la réserve est dépensée sans que personne ne décide de la dépenser. Traitez-le comme un actif contrôlé avec un propriétaire nommé et un journal de bord, et rafraîchissez peut-être un cinquième de celui-ci chaque année afin qu'il trace la dérive dans ce que vous recevez réellement. Un ensemble assemblé il y a trois ans et jamais rafraîchi mesure une charge de travail qui n'existe plus.
Réévaluer le titulaire par rapport à la moitié de la réserve à chaque renouvellement et par rapport à un nouvel échantillon chaque année. Lisez les deux ensemble : une forte performance sur l'ensemble original avec une performance plus faible sur l'échantillon frais est la signature de dérive, soit dans le système du vendeur ou dans vos propres intrants, et la distinction vaut la peine d'être établie avant la discussion du contrat plutôt que pendant celui-ci.
Conclusion éditoriale: Les processus d'approvisionnement pour l'IA sont…
Les processus d'approvisionnement pour l'IA sont élaborés dans toutes les dimensions sauf celle qui décide de la qualité. Deux semaines de temps d'un analyste, passé avant le premier appel du vendeur, convertit une décision prise sur les impressions en une décision faite sur les preuves — et laisse à l'organisation un instrument qu'elle peut encore utiliser lors du renouvellement, qui est la partie que personne ne s'attend et tout le monde finit par avoir besoin.
Checklist pratique
- Premier mouvement — Échantillonner deux cents cas réels avec des résultats connus cette quinzaine, les diviser en deux, et envoyer les cent premiers à chaque fournisseur sur la liste.
- Ce qu'il faut mesurer — Score la précision sur l'ensemble retenu, le profil d'erreur par catégorie, le coût par millier de cas à votre volume, et la latence à votre pic plutôt que la moyenne.
- Mode de défaillance à regarder — Le principal risque est de construire l'ensemble à partir d'enregistrements historiques propres, qui produit un repère qui ne ressemble plus aux entrées mesquines que le système recevra réellement.
- Attribuer un propriétaire visible et une date d'examen. — Les processus d'approvisionnement pour l'IA sont élaborés dans…
- Des preuves distinctes de l'interprétation. — La chose la moins chère qu'un acheteur peut faire avant qu'un…
- Saisir une base de référence avant de modifier le processus. — La chose la moins chère qu'un acheteur peut faire avant qu'un…
Questions et réponses
Comment évaluez-vous objectivement les fournisseurs d'IA?
Construisez un ensemble tenu de vos propres cas avec des résultats connus avant tout contact avec un fournisseur, envoyez chaque fournisseur le même sous-ensemble dans le même format, et faites marquer les résultats par quelqu'un qui n'a pas assisté aux démos.
Combien d'exemples faut-il pour une évaluation de l'IA?
Environ deux cents est généralement suffisant et prend un analyste environ deux semaines. Échantillon dans la distribution que vous recevez réellement, y compris les intrants malformés et les cas sur lesquels vos propres experts sont en désaccord.
Pourquoi garder la moitié de l'évaluation en réserve?
Une fois que des exemples sont partagés avec un fournisseur, ils cessent d'être une mesure retenue, et tout renouvellement marqué sur eux mesure la mémorisation. Une partition de réserve qui n'est jamais partagée est ce qui rend la décision de renouvellement fondée sur des données probantes.
La précision est-elle la bonne mesure pour un fournisseur d'IA?
Pas tout seul. Le profil d'erreur est plus important, car les erreurs ne sont pas interchangeables : un système à 92 % qui échoue au hasard est généralement meilleur qu'un système à 94 % qui échoue systématiquement dans une catégorie qui rapporte un cinquième des recettes.
L'ensemble d'évaluation devrait-il décider du gagnant?
Elle devrait décider de la liste restreinte. Utilisez-le pour éliminer les systèmes qui ne peuvent pas faire le travail, puis choisissez entre les survivants sur le modèle de soutien, les termes des données, le coût de sortie, et comment droite l'équipe répond aux questions difficiles.

