Короткий ответ
25 августа 2026 года OpenAI сообщила, что в трёх тестируемых открытых моделях Jalapeño обеспечил в 1,5–1,9 раза больше ИИ-работы на ватт при пиковой пропускной способности и в 1,7–3,6 раза меньшую сквозную задержку, чем системы сравнения. Это результаты конкретного бенчмарка, а не обещание для любой модели и нагрузки.
Проверенные факты
- Дата публикации
- 25 августа 2026 года
- Проверенные модели
- GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T
- Бенчмарк
- SemiAnalysis InferenceX
- План внедрения
- OpenAI планирует начать внутреннее внедрение до конца 2026 года
Что именно OpenAI опубликовала 25 августа 2026 года
OpenAI представила первые измеренные показатели Jalapeño — собственного чипа и стоечной системы для инференса языковых моделей. По данным компании, испытания проводились в публичном бенчмарке InferenceX от SemiAnalysis на GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. В этих тестах OpenAI заявила о 1,5–1,9 раза большей работе ИИ на ватт при пиковой пропускной способности и о 1,7–3,6 раза меньшей сквозной задержке относительно выбранных коммерческих систем. В режимах с высокой интерактивностью заявленное преимущество составило 2,1–4,1 раза.
Эти числа относятся к конкретным моделям, настройкам и границам измерения. Они не означают, что Jalapeño автоматически быстрее для любой модели, длины контекста, точности вычислений или схемы обслуживания. Публикация полезна тем, что называет модели, номинальные длины входа и выхода, оборудование сравнения, допущения о мощности и несколько метрик. Но правильный вывод всё равно начинается с условий: бенчмарк показывает результат внутри тестовой рамки, а промышленный вывод требует доказательства, что эта рамка похожа на реальную нагрузку компании.
Почему пропускную способность на ватт нельзя отделять от задержки
Инференс часто описывают одной цифрой — токенами в секунду или общей пропускной способностью. Этого недостаточно для пользовательского продукта. Система может эффективно объединять много запросов в пакет, но заставлять отдельного пользователя ждать. Обратный вариант тоже возможен: один запрос обслуживается быстро, а дорогое оборудование простаивает. OpenAI подчёркивает сочетание работы на единицу мощности, сквозной задержки и времени между токенами. Эти оси следует читать вместе, потому что интерактивный сервис одновременно управляет скоростью ответа, ёмкостью и стоимостью.
Для ИИ-агентов баланс ещё важнее. Обычный чат может выполнить одну генерацию, а агент последовательно вызывает модель, инструменты и проверки. Небольшие задержки складываются на каждом шаге. Более низкая задержка сокращает всю задачу, а более высокая полезная пропускная способность позволяет той же инфраструктуре выполнять больше параллельной работы. Энергоэффективность важна потому, что электричество и охлаждение ограничивают плотность вычислений в дата-центре. Но выгода сохранится только в том случае, если модель, планировщик, кеш, сеть и программный стек перенесут её из контролируемого теста в реальный трафик.
Что на самом деле охватывает сравнение InferenceX: Промышленная квалификация, программное обеспечение и…
InferenceX измеряет путь обслуживания запроса шире, чем теоретический пик арифметического блока. OpenAI заявляет, что проверила Jalapeño в режимах от высокой общей пропускной способности до низкой задержки для интерактивной работы. В приложении к публикации приведены три открытые модели и несколько точек на кривой производительности. Это лучше одиночного рекорда, потому что снижает вероятность того, что весь заголовок построен вокруг одной удобной конфигурации.
При этом границы остаются. Jalapeño имеет паспортный рейтинг 700 ватт; OpenAI говорит, что фактическая постоянная мощность в тестах не превышала 550 ватт. Для нормализованного сравнения использованы опубликованные рейтинги корпусов ускорителей. Такой подход сохраняет единообразие, но не равен измерению целой стойки, сети, охлаждения и инфраструктурных потерь в одинаковых условиях. Результат также меняют точность модели, зрелость ядер, длина входа и выхода, пакетирование, повторное использование кеша и параллелизм. Нельзя сравнивать мощность корпуса на одной платформе с полной системой на другой.
Зачем разработчику моделей собственная система инференса
OpenAI описывает Jalapeño как совместно спроектированную систему из чипа, памяти, сети и серверного программного обеспечения. Разные фазы языковой модели упираются в разные ограничения: обработка запроса требует вычислений, генерация токенов часто ограничена пропускной способностью памяти, а обмен данными заставляет блоки ждать. Архитектура, построенная вокруг этих фаз, может иначе размещать состояние модели, вычисления и сеть, чем универсальный ускоритель. Стратегическая цель — лучше контролировать задержку, энергию, планирование мощности и стоимость обслуживания моделей в большом масштабе.
Но собственный чип не означает отказ от поставщиков. OpenAI пишет, что системы Microsoft, NVIDIA и других партнёров остаются основой инфраструктуры, а ускорители NVIDIA продолжат использоваться и для обучения, и для инференса. В июньском сообщении Broadcom Jalapeño описывался как совместная разработка под инференс LLM, а не универсальная замена внешнего оборудования. Собственный кремний может дать дополнительный путь, рычаг в переговорах и специализированную эффективность. Реальный вопрос — как распределятся нагрузки, когда стоимость, доступность, надёжность и совместимость будут измеряться в одной модели.
Чего первые результаты пока не устанавливают
Публикация не раскрывает полную стоимость производства и эксплуатации Jalapeño в масштабе. Работа на ватт влияет на экономику, но TCO включает выход годных кристаллов, корпусирование, память, сеть, стойки, подачу энергии, охлаждение, разработку ПО, квалификацию, обслуживание и загрузку. Бенчмарк также не доказывает доступность. Промышленный сервис требует стабильных поставок, известного поведения при отказах, мониторинга, процедуры замены и достаточного числа систем для поглощения всплесков спроса. Для первого поколения эти вопросы нормальны; они просто находятся за пределами графика производительности.
Результаты не доказывают такое же преимущество для каждой закрытой передовой модели и каждого агентного сценария. OpenAI говорит, что во внутренних тестах преимущество на собственных моделях было шире, но публичное сравнение относится к трём названным открытым моделям. Именно это сегодня можно проверить. Компания также сообщает, что промышленная квалификация продолжается, программный стек развивается, а список моделей расширяется. Осторожный вывод таков: Jalapeño показал сильные результаты в раскрытой конфигурации и создал реальный собственный путь инференса, но производственная эффективность, надёжность и широта ещё требуют следующих публикаций.
Как проверить заявление на собственной рабочей нагрузке
Начните не с производителя, а с нагрузки. Зафиксируйте модель, числовую точность, среднюю и хвостовую длину входа, длину ответа, параллелизм, повторное использование кеша, время до первого токена, интервал между токенами и требуемую долю успешно выполненных задач. Определите, что важнее продукту: мгновенный ответ одному пользователю, дешёвая пакетная обработка или контролируемый баланс. Затем сравнивайте платформы при одинаковом уровне сервиса. Если одной разрешена более медленная реакция или другая точность, экономическое сравнение отвечает уже на другой вопрос.
Сохраняйте одну границу системы. Либо измеряйте ускоритель, память и сеть на каждой платформе, либо применяйте одинаковое паспортное допущение и явно называйте ограничение. Добавьте стойку, оркестрацию, ПО и надёжность до расчёта полной стоимости. Используйте устойчивую, а не кратковременную пиковую пропускную способность; включайте p95 и p99 задержки; для агентов считайте завершённые полезные запросы, а не токены, потому что повторы и ошибки инструментов меняют результат. Повторите испытание после обновления ПО и на реальном распределении трафика. Невоспроизводимая оценка остаётся снимком, а не методом закупки.
Что отслеживать между бенчмарком и внедрением
OpenAI планирует начать внедрение Jalapeño в собственную инфраструктуру до конца 2026 года, а следующие поколения уже находятся в разработке. Значимыми станут операционные показатели: какие нагрузки переведут первыми, сколько мощности установят, какую загрузку система сможет держать, расширится ли поддержка моделей, как поведёт себя хвостовая задержка и сохранится ли надёжность в длительном трафике. Изменение скорости, доступности или цены для клиента будет сильнее доказывать бизнес-ценность, чем ещё один изолированный пик.
Сигнал шире одной компании. Разработчики моделей, облачные платформы и производители чипов всё чаще конкурируют как полные системы. Главной единицей становится полезная задача, завершённая внутри ограничений по задержке, мощности, надёжности и стоимости, а не отдельный ускоритель. Первые результаты Jalapeño усиливают этот тренд, связывая потребности разработчика моделей, собственный кремний и публичный бенчмарк. Вывод должен оставаться условным: сильная раскрытая производительность сегодня, промышленная квалификация и экономическое доказательство — на следующем этапе.
Практический чеклист
- Сопоставьте модель, точность, длину входа и выхода и параллелизм бенчмарка с собственной рабочей нагрузкой.
- Проверьте, измерена ли мощность фактически или взята из паспортного рейтинга, и используйте одну границу для всех систем.
- Сравнивайте сквозную задержку и скорость для пользователя вместе с общей пропускной способностью.
- Добавьте стоимость стойки, сети, памяти, программного обеспечения, загрузки и квалификации до расчёта TCO.
- Повторите тест после промышленного внедрения с хвостовой задержкой, надёжностью и долей успешно завершённых задач.
Вопросы и ответы
Для чего предназначен чип OpenAI Jalapeño?
Jalapeño — собственный ускоритель и система для инференса языковых моделей, то есть для обслуживания уже обученных моделей и генерации ответов. OpenAI не называет его заменой всем обучающим ускорителям и продолжит использовать оборудование партнёров.
Какие модели вошли в первые опубликованные тесты?
OpenAI опубликовала результаты GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T в публичном бенчмарке InferenceX от SemiAnalysis, охватив модели нескольких разработчиков и разные режимы работы.
Доказывают ли цифры бенчмарка меньшую стоимость в продакшене?
Нет. Производительность на ватт влияет на экономику, но полная стоимость включает производство, память, сеть, стойки, охлаждение, программное обеспечение, загрузку, надёжность и квалификацию.
Когда Jalapeño появится в инфраструктуре OpenAI?
OpenAI планирует начать внедрение Jalapeño в собственную вычислительную инфраструктуру до конца 2026 года. Компания отдельно отмечает, что промышленная квалификация, развитие ПО и проверка дополнительных моделей продолжаются.

