VJOURNAL

ИнновацииГлобальная редакция09 августа 2026 г.

Составьте набор для оценки до встречи с поставщиком ИИ, а не после пилота

Самое дешевое, что может сделать покупатель перед закупкой ИИ — собрать двести собственных примеров с известными ответами. Почти никто этого не делает, и выбор часто решает демо.

Абстрактное синее изображение букв A и I

Короткий ответ

Whoever supplies the examples decides the outcome of an AI evaluation. If the vendor brings the demo data, the procurement has already been settled before the first meeting.

2 источника
Тот, кто предоставляет примеры, определяет исход оценки ИИ. Если поставщик привозит данные для демонстрации, решение о закупке принято до первой встречи.
Оценивайте точность по отложенному набору, профиль ошибок по категориям, стоимость за тысячу случаев при вашем объеме и задержку на пике, а не в среднем.
За две недели отберите двести реальных случаев с известными результатами, разделите их на две части и отправьте первые сто всем поставщикам из списка.

Основная идея

Кто предоставляет примеры, тот и определяет исход оценки ИИ. Если поставщик приносит демонстрационные данные, решение о закупке уже принято до первой встречи.

Процессы выбора ИИ обычно строятся на серии демонстраций. Каждый поставщик показывает свое решение, все демонстрируют его хорошо, а команда по закупкам сравнивает впечатления от систем, показанных на материалах, выбранных поставщиком. Все понимают, что это слабый метод, и часто делают пилотный проект — дорогой, долгий, и всё равно формально оцениваемый теми же, кто смотрел демонстрации.

Что изменилось и почему это важно сейчас

Очевидно по тому, как сужается шортлист. Команды, выбирающие по демонстрациям, приходят к предпочтению, которое сложно объяснить — «кажется, лучше», «команда сильнее», «план понятнее». Те, кто смотрит на числовые показатели по собственным примерам, спорят о весах метрик, а не о впечатлениях. Конструктивные споры по фактам ведут к обоснованным решениям; споры по ощущениям ведут к контрактам на три года, которые невозможно оправдать через полтора.

Создание операционной модели

Составьте отложенный набор собственных кейсов с известными правильными ответами до контакта с поставщиками, и оценивайте каждую демонстрацию по нему в одинаковых условиях.

Двести примеров — обычно достаточно, и это можно сделать за две недели. Отбирайте их из фактического распределения входных данных, с учетом обычных случаев, сезонных и крайних, ошибочных и тех, по которым ваши эксперты расходятся во мнениях. Последняя категория — самая полезная и часто исключается, поскольку в ней нет внутреннего согласия. Сначала установите правильные ответы внутри организации и зафиксируйте расхождения. Спорные случаи нельзя считать ошибками поставщика, но они показывают, где процесс неоднозначен.

Что оценивать

Оценивайте точность по отложенному набору, профиль ошибок по категориям, стоимость за тысячу случаев при вашем объеме и задержку на пиковых нагрузках, а не среднюю.

Профиль ошибок важнее общей точности, потому что ошибки не равнозначны. Система с 92 % точности и случайными ошибками лучше, чем 94 % и системными ошибками в категории, которая дает пятую часть дохода. Отчитывайтесь по категориям отдельно и не используйте усредненные показатели. По стоимости учитывайте реальное распределение, включая повторы (ретрай) и длинные вводы, так как цены за единицу расчетные по среднему занижают реальные затраты при промышленном использовании.

Где возникают проблемы

Главный риск — создавать набор из чистых исторических данных, который не отражает реальные «грязные» входные данные.

Второй риск — утечка набора. После передачи примеров поставщику для пилота они перестают быть отложенной мерой в последующих циклах. Решения о продлении, оцениваемые по ним, измеряют запоминание. Храните резервный набор, который никогда никому не показывайте, используйте только при продлении, и держите в секрете. Это обычная административная гигиена, и разница между решением, основанным на доказательствах, и на знании продавца.

Как это выглядит на практике

На практике это упражнение занимает у одного аналитика две недели и полностью меняет процесс закупок. Поставщикам отправляют одни и те же сто кейсов, они возвращают результаты в фиксированном формате, а оценку ставит человек, который не присутствовал на демонстрациях. Оставшиеся сто кейсов остаются в резерве. Последующие разговоры заметно отличаются: поставщики спрашивают о категориях ошибок, а не о сроках, и те, кто серьезно разбирается в категории, где они показали плохой результат, обычно и заслуживают попадания в шорт-лист. Это также меняет внутренние обсуждения. Комитет по закупкам, который неделями спорил о том, какая система кажется более способной, может разрешить спор за один день, когда одни и те же сто кейсов пройдены в каждой системе, и остаточные разногласия касаются того, насколько важна для бизнеса конкретная категория ошибок — что является решением, которое комитет действительно компетентен принимать, и на чем ему следовало бы сосредоточить своё время. Практическое предупреждение: зафиксируйте формат вывода до отправки чего-либо. Запрос на свободные ответы приведёт к тому, что поставщики вернут разные форматы, и оценка превратится в упражнение по интерпретации, которое снова введёт именно ту субъективность, ради устранения которой набор и был создан. Краткой схемы и одного выполненного примера достаточно, и на это уйдёт час.

Самый мощный аргумент против

Справедливое возражение в том, что отложенный набор поощряет то, что можно измерить, и наказывает то, что измерить нельзя. Системы отличаются тем, как они ошибаются, объясняют себя и ведут себя с незнакомыми данными — и чисто количественный подход может выбрать оптимизированный под бенчмарк продукт, а не по-настоящему лучший.

Поэтому набор должен отбирать шортлист, а не победителя. Используйте его для исключения непригодных, а между оставшимися выбирайте по качественной стороне — поддержка, условия работы с данными, стоимость выхода и честность команды. Набор убирает выбор по впечатлениям, что на самом деле значительный прогресс.

План внедрения на 30 дней

За две недели соберите двести реальных кейсов с известными результатами, разделите на две части и отправьте первые сто всем поставщикам.

Дни 1–3 — определите категории и рамки отбора. Дни 4–8 — выберите кейсы и два специалиста отметят их независимо друг от друга, уровень расхождений — ваш верхний порог для поставщиков. Дни 9–10 — разрешите или исключите спорные случаи и зафиксируйте набор. День 11 — разделите и надежно сохраните резервную половину, недоступную закупочной команде для случайного доступа. День 12 и далее — запустите всех поставщиков по одинаковому набору, в одинаковом формате, оценка слепая.

Держите резервную половину действительно в резерве

Записывайте, кто имеет доступ к резервной части и когда она последний раз использовалась. Сбой редко бывает преднамеренным: кому-то нужен быстрый контроль перед обновлением, он берет ближайший доступный набор, и резерв заканчивается, даже если никто не решил его использовать. Рассматривайте его как контролируемый актив с назначенным владельцем и журналом, и обновляйте примерно пятую часть ежегодно, чтобы она отражала изменения в том, что вы действительно получаете. Набор, собранный три года назад и никогда не обновлявшийся, измеряет нагрузку, которой больше нет.

Переоценивайте текущий результат по отношению к резервной половине при каждом обновлении и по отношению к свежему образцу ежегодно. Анализируйте обе оценки вместе: сильные показатели на исходном наборе и более слабые на новом образце — признак смещения, либо в системе поставщика, либо во входных данных, и это различие стоит выявить до обсуждения контракта, а не во время него.

Заключение редакции

Процессы закупок ИИ сложны во всех аспектах, кроме ключевого — оценки качества. Две недели работы аналитика до первой встречи с поставщиком превращают необоснованное решение в принятое на основе доказательств — и дают организации инструмент, который будет полезен даже при продлении контракта, чего никто не планирует и всем он почему-то нужен.

Практический чеклист

  • Первое действие — в течение двух недель отберите двести реальных случаев с известными исходами, разделите на две части и отправьте первые сто всем поставщикам из списка.
  • Что оценивать — точность по отложенному набору, профиль ошибок по категориям, стоимость за тысячу случаев при вашем объеме и задержку в пике, а не в среднем.
  • Что контролировать — главный риск в том, что набор создают из чистых исторических данных, не отражающих реальные «грязные» входные данные.
  • Назначьте ответственного и дату пересмотра.
  • Разграничьте доказательства и интерпретации.
  • Зафиксируйте базовые показатели до изменения процесса.

Вопросы и ответы

Как объективно оценить поставщиков ИИ?

Создайте отложенный набор своих кейсов с известными результатами до контакта с поставщиками, отправьте одинаковый поднабор каждому в одном формате, а оценки проводите те, кто не присутствовал на демонстрациях.

Сколько примеров нужно для оценки ИИ?

Обычно около двухсот достаточно — это около двух недель работы одного аналитика. Отбирайте примеры из реального распределения, включая некорректные данные и спорные случаи.

Зачем держать половину набора в резерве?

Поделённые с поставщиком примеры перестают быть отложенными, а обновленная оценка по ним измеряет просто запоминание. Резерв используется только при продлении, чтобы решения были основаны на доказательствах.

Точность — единственный важный показатель для поставщика ИИ?

Нет. Важнее профиль ошибок, поскольку ошибки разной природы нельзя заменить друг другом. Лучше случайные ошибки при 92 %, чем системные ошибки в важной категории при 94 %.

Должен ли набор оценки выбирать победителя?

Он должен отобрать шортлист. Используйте его для исключения непригодных систем, а между оставшимися выбирайте по качеству поддержки, условиям данных, стоимости выхода и честности команды.