Зачем нужна нейросеть, которая не пишет ответы

В службу поддержки приходит сообщение: «После оплаты деньги списались, но подписка не появилась».

Прежде чем отвечать клиенту, система должна определить тему обращения, выбрать нужный отдел и решить, достаточно ли информации для автоматической обработки. Для этого не обязательно составлять длинный текст. Нужны несколько конкретных оценок.

Именно для таких задач TypeSafe AI представила Jev. Разработчики относят её к System One models — моделям, которые оценивают входные данные и возвращают структурированные решения для программы. Jev была представлена 15 сентября 2026 года. Анонс TypeSafe AI.

Выражение Jev-type models удобно использовать для моделей с похожим подходом: им передают контекст, вопрос и допустимые варианты ответа, а получают результат, который можно использовать в коде. Jev — имя конкретной модели; у похожих решений могут быть другое устройство и другие ограничения.

Как работают модели типа Jev

Работу Jev можно описать четырьмя шагами:

  1. Передать состояние. Это данные, которые нужно оценить: сообщение клиента, фрагмент документа или запись из базы.
  2. Задать конкретный вопрос. Например: «Какой отдел должен обработать это обращение?»
  3. Определить форму ответа. Выбор из списка, оценка по шкале или вероятность ответа «да».
  4. Обработать результат в программе. Направить обращение, запросить дополнительные данные или передать случай человеку.

В терминологии TypeSafe входные данные называются state, а вопросы — questions. Несколько вопросов об одном состоянии могут оцениваться независимо и параллельно в одном запросе. Документация Jev.

При этом независимость вопросов нужно учитывать при проектировании. Если второй вопрос требует результата первого, такую последовательность следует организовать в программе.

Три формы ответа

У Jev есть три основных типа вопросов:

ТипДля чего подходитПример
ChoiceВыбрать один вариант из заданного набораОплата, доступ к аккаунту или техническая проблема
ScoreОценить данные по описанной шкалеНезначительная, существенная или критическая проблема
NoulОценить вероятность ответа «да»Просит ли клиент связаться с человеком?

Для Choice модель возвращает выбранный вариант и вероятности вариантов. Для Score — оценку и распределение по уровням шкалы. Оба типа также возвращают показатель confidence. Noul возвращает число от 0 до 1 — вероятность положительного ответа. Choice, Score, Noul.

Разработчику всё равно нужно объяснить, что означают категории и уровни. Шкала «плохо — нормально — хорошо» оставляет больше неопределённости, чем конкретные критерии для каждого уровня.

Чем Jev отличается от обычных LLM

Большинство привычных чат-моделей формируют ответ последовательно, по токенам — небольшим фрагментам текста. Они могут написать письмо, объяснить ошибку или предложить план.

Jev ориентирована на другой результат: ограниченный набор значений, который заранее определил разработчик. TypeSafe описывает получение её ответов как параллельное, без последовательной генерации текста. Описание подхода.

КритерийГенеративная чат-модельJev
Основной результатТекст, код, объяснениеВыбор, оценка, вероятность
Возможные ответыОткрытый набор при свободной генерацииЗаданы через вопрос и критерии
Объяснение решенияМожет сформироватьНе генерирует
Типичная задачаПодготовить ответ клиентуОпределить маршрут обращения
Работа с неопределённостьюЗависит от модели и интерфейсаВероятности входят в результат
Сравниваем обычный режим генерации текста с интерфейсом Jev. LLM также могут работать со структурированными ответами.

Это различие не означает, что LLM неспособны классифицировать обращения или выдавать структурированные данные. Они тоже решают такие задачи.

В исследовании LLM-as-Jev, опубликованном в октябре 2026 года, авторы показали, как получать решения из вероятностей вариантов у существующих LLM, сохраняя их архитектуру. В их экспериментах дополнительное обучение помогало отдельным моделям и задачам, но не давало универсального улучшения. Препринт LLM-as-Jev.

Поэтому похожий интерфейс ещё не означает одинаковое внутреннее устройство. Подробная архитектура и методика обучения коммерческой Jev остаются закрытыми; переносить на неё устройство сторонних реализаций некорректно.

Что означает «калиброванная вероятность»

TypeSafe называет свой подход к обучению RLCD — Reinforcement Learning for Calibrated Decisions, то есть обучение с подкреплением для калиброванных решений.

Цель — сделать вероятности полезными для программы. Если хорошо откалиброванная модель присваивает событиям вероятность 80%, то на большой группе сопоставимых примеров такие события должны происходить примерно в 80% случаев.

Это свойство группы прогнозов. Оно не гарантирует правильность отдельного ответа. Объяснение RLCD и калибровки.

Также не следует смешивать вероятность варианта и confidence. У Jev показатель confidence для Choice и Score вычисляется из распределения вероятностей: он отражает, насколько явно модель предпочитает один исход другим. Это не самостоятельная гарантия точности. Документация о confidence.

На практике программа может автоматически обрабатывать уверенные случаи, а неоднозначные отправлять на проверку. Границы между ними нужно выбирать по результатам испытаний и последствиям ошибки.

Где такие модели можно применять

Распределение обращений и выбор обработчика

Модель определяет намерение пользователя, а программа выбирает следующий шаг: запрос к базе, специализированную LLM или сотрудника.

Например, вопрос о статусе заказа можно обработать через базу данных, а сложную жалобу передать человеку. Такой сценарий описан в документации TypeSafe. Маршрутизация запросов.

Отбор документов перед генерацией ответа

В системах RAG поиск сначала находит фрагменты документов, а генеративная модель использует их для ответа.

Между этими этапами можно добавить модель принятия решений. Она оценивает, относится ли фрагмент к вопросу, содержит ли полезные сведения и противоречит ли исходному предположению пользователя. Программа решает, какие материалы передать дальше. Пример фильтрации RAG-фрагментов.

Если термин RAG вам пока незнаком, начните с нашего материала «Что такое RAG — на примере папки с документами».

Оценка материалов по понятным критериям

Score можно использовать для предварительной оценки серьёзности ошибки, соответствия текста заданию или релевантности материала.

Здесь полезнее задавать отдельные вопросы: «Ответ касается запроса?», «Основные утверждения подтверждены источником?», «Есть ли существенные пропуски?». Затем программа объединяет оценки по явным правилам. Такой подход позволяет менять вес критериев и видеть, из чего сложилась итоговая оценка. Рекомендации по построению системы.

Практический пример: обращение об оплате

Возьмём сообщение:

«После оплаты деньги списались, но подписка не появилась. В аккаунт войти могу».

Для первого решения достаточно сформулировать вопрос:

Какова основная тема обращения: списание или оплата, вход в аккаунт, другая техническая проблема либо недостаточно данных?

К каждой категории нужно добавить описание. Например, категория оплаты включает списания и активацию после платежа, а категория входа — невозможность авторизоваться.

Это иллюстративный сценарий, а не результат нашего тестирования Jev.

После классификации программа может направить обращение в нужную очередь. Проверять факт платежа следует по данным платёжной системы. Модель оценивает смысл сообщения; само сообщение не доказывает, что транзакция состоялась.

Такое разделение соответствует рекомендациям TypeSafe: модель отвечает на узкие смысловые вопросы, а код управляет проверками и действиями. Как строить систему с Jev.

Ограничения: правильный формат не гарантирует правильного решения

Ответ может соответствовать заданной структуре и при этом содержать неверный выбор. Например, модель вернёт существующую категорию обращения, но направит его не в тот отдел.

В документации для версии jev-1.13 TypeSafe перечисляет ограничения:

  • ненадёжный подсчёт и задачи с числовой точностью;
  • ошибки при сравнении дат и времени;
  • трудности со сложными цепочками рассуждений;
  • снижение качества при большом количестве нерелевантных данных;
  • чувствительность к противоречивым инструкциям и порядку вариантов;
  • возможность влияния вредоносных инструкций во входном тексте.

Эти замечания относятся к указанной версии Jev. Их нельзя автоматически приписывать всем моделям с похожим интерфейсом. Известные ограничения jev-1.13.

По текущей документации Jev принимает текстовые данные, включая строки и JSON. Прямой ввод изображений, аудио и видео не поддерживается. Она также не пишет объяснения своих решений. Возможности System One.

Что показывают независимые проверки

В препринте от 29 сентября 2026 года исследователи оценили Jev на 37 наборах данных. Они обнаружили хорошую калибровку вероятностей Choice во многих задачах, но также проблемы с отдельными задачами, языками и бинарными оценками.

В частности, порог 0,5 для Noul оказался удачным не во всех сценариях: настройка порогов на отдельных обучающих данных улучшала некоторые результаты. Независимая оценка Jev.

Это исследование помогает понять поведение модели на выбранных тестах. Для конкретного продукта всё равно нужна проверка на его данных — включая русскоязычные сообщения, неоднозначные формулировки и редкие случаи.

Как понять, подходит ли модель вашей задаче

Начните с одного решения, которое сейчас принимает человек или генеративная модель.

  1. Опишите допустимые ответы. Добавьте исход «недостаточно данных», если он нужен.
  2. Подготовьте примеры с проверенными ответами. Включите обычные, пограничные и ошибочные входные данные.
  3. Сравните несколько подходов. Простые правила, обычный классификатор, LLM и модель типа Jev.
  4. Измерьте результат всей системы. Точность, задержку, стоимость и долю случаев, требующих проверки.
  5. Проверьте вероятности и пороги. Для настройки и итоговой оценки используйте разные примеры.
  6. Повторите проверку после изменений. Новая версия модели, категории или инструкции могут изменить поведение.

Если вам нужно написать письмо, объяснить тему или подготовить черновик, выбирайте генеративную модель. Если программа регулярно принимает решение из ограниченного набора вариантов, имеет смысл проверить специализированный подход.

Для повседневных задач начните с нашего руководства «Как выбрать нейросеть под задачу и не переплачивать» и попробуйте свой сценарий в BebrGPT.

Поделиться материалом
Telegram