Конспект видео

Jev против LLM: System 1 и System 2

Шон Чен объясняет на доске Excalidraw, чем модель Jev от TypeSafe AI отличается от чат-моделей, а потом гоняет её против Claude Opus, Haiku 4.5 и GPT-5.4 Mini на 15 вопросах с человеческой разметкой.

⏱ 22:29 ▶ YouTube Sean’s AI Stories 7 614 просмотров язык: английский
▶ Смотреть на YouTube
Превью видео: Jev против LLM
Главный тезис: Jev не разговаривает. На вход он получает JSON с контекстом и вопросами, на выход отдаёт JSON с распределением вероятностей. В тесте автора он примерно в 10 раз быстрее и в 145 раз дешевле Claude Opus, но по точности уступает ему. Поэтому автор видит в Jev дополнение к LLM для быстрых простых решений, а не замену.
01

TL;DR

Что такое Jev

Модель компании TypeSafe AI. Пост о запуске от Диогу Алмейды, одного из создателей ChatGPT, набрал больше 38 млн просмотров. Сама модель называет себя System 1: быстрые интуитивные решения без цепочки рассуждений.

Как с ней говорят

Никакого промпта. Вы передаёте state (контекст) и список вопросов одного из трёх типов: Noul (да/нет), Choice (выбор варианта), Score (уровень на шкале). Ответ приходит только в JSON.

Что показала гонка

На входящих сообщениях инвесторам: Opus 14/15 за 2768 мс и $2,93 за 1 000 вызовов, Jev 13/15 за 286 мс и $0,02. Haiku и GPT-5.4 Mini медленнее и дороже Jev, а ответили хуже.

Где Jev ошибается

Почти все промахи пришлись на вопросы типа Score. На поиске по памяти Jev тоже не всегда самый точный: лидером по качеству остаётся Opus.

02 · 0:36 2:54 4:19

Две системы мышления на одном примере

Деление взято из книги Даниэля Канемана «Думай медленно… решай быстро» (Thinking, Fast and Slow). System 1 отвечает мгновенно: «Хочу пить. Выпить воды? Да». «Стою на краю обрыва. Прыгать? Нет». System 2 рассуждает долго и подробно, как современные LLM.

System 2 · LLM

Один промпт, длинное рассуждение, JSON только по просьбе
prompt «Waku.one — самая недооценённая система памяти для агентов» + «подумай» LLM много текста рассуждения {"intent": "invest", "confidence": 0.97}

System 1 · Jev

State + типизированные вопросы, ответ — распределения
state контекст: сообщение о Waku.one questions Noul: invest? Choice: {3} Score: 0…3 Jev Noul yes 0,94 no 0,06 Choice invest 0,98 acquire 0,01 join 0,01 Score 1,99 ≈ angel confidence: 98% у Choice, 99% у Score

В обычном сценарии LLM нужно отдельно просить «подумай, а в конце ответь JSON». Во времена GPT-3.5 модели регулярно забывали эту инструкцию и добавляли к JSON абзацы пояснений, из-за чего агентные пайплайны ломались. Jev снимает проблему на уровне модели: человеческий текст он не выдаёт вообще.

Доска Excalidraw: схемы System 2 LLM и System 1 Jev
1:24📺 Как это в видео: исходная доска автора. Цифры на ней совпадают с перерисованной схемой выше.
03 · 6:04 8:48

Три типа вопросов и что они возвращают

Пример на доске: я фонд уровня a16z, Sequoia или Y Combinator и решаю, что делать с Waku.one. Тип вопроса задаётся жёстко, и от него зависит форма ответа. Любой ответ — это распределение: набор вероятностей, которые в сумме дают единицу.

Noul · да или нет

Инвестировать?

Булев вопрос. Автор вспоминает слушания в Конгрессе, где CEO TikTok отвечал «я сингапурец»: вариантов ровно два.

yes94%
no6%

При пороге 50% итоговый ответ — «да».

Choice · один вариант из набора

Вложиться, купить или присоединиться?

Варианты взаимоисключающие. Фонд может так влюбиться в стартап, что партнёр уйдёт к нему работать; автор говорит, что такое бывает.

invest98%
acquire1%
join1%

Плюс поле confidence: 98%. Как оно считается, автор в документации не нашёл.

Score · уровень, а не выбор

Насколько крупно вложиться?

Варианты упорядочены: 0 — ничего, 1 — пойти следом за чужим раундом (около $200 тыс.), 2 — ангельский чек, 3 — возглавить раунд на $5 млн. Модель считает матожидание.

0
none
1
follow
2
angel
3
lead

1,99 при confidence 99%: ближе всего к ангельскому чеку.

Живой запрос в TypeSafe playground

Автор проверяет ту же схему в console.typesafe.ai/playground. В state — входящее сообщение ангельскому инвестору от основателя Waku.one: «сейчас не поднимаем, репозиторий и так растёт, но пара человек спросили, так что последний SAFE открыт на тех же условиях; если хотите зайти на 50K, это до пятницы».

// questions (сокращено)
{
  "soliciting": { "type": "noul",
    "instructions": "The author is asking the reader
      to put money into the company..." },
  "intent": { "type": "choice",
    "criteria": { "invest", "acquire",
                  "join", "none" } },
  "size": { "type": "score",
    // 0 nothing · 1 small follow-on
    // 2 standard check $25k–100k · 3 lead the round }
}

Ответ: soliciting — 94% true; intent — invest 98%, none 2%, join и acquire по 0%, confidence 98%; size — 1,99 при confidence 99%. Серверное время — 102 мс.

Интерфейс TypeSafe playground с вопросами и ответами Jev
13:38Playground: вопросы в JSON и ответы с распределениями под ними.

Один прогон в playground ничего не доказывает, поэтому автор собрал отдельный стенд для сравнения моделей 14:20.

05 · 14:54 15:37

Гонка суждений: Jev против трёх LLM

Стенд живёт в открытом репозитории waku-agent и запускается командой uv run waku dashboard. Пять категорий: входящие сообщения инвесторам, память, поддержка, возвраты, лиды. В каждой 15 вопросов: пять кейсов, в каждом по одному вопросу Noul, Choice и Score. Правильные ответы размечены человеком.

TypeSafe в посте о запуске обещает, что Jev в 20–200 раз быстрее и в 40–400 раз дешевле по выходным токенам. Проверка на категории «входящие сообщения инвесторам» дала такую итоговую таблицу:

Правильных ответов из 15

claude-opus-514/15
Jev13/15
gpt-5.4-mini12/15
claude-haiku-4-511/15

Задержка p50 на вызов (меньше — лучше)

claude-opus-52768 мс
Jev286 мс
gpt-5.4-mini1020 мс
claude-haiku-4-5645 мс

Цена за 1 000 вызовов (меньше — лучше)

claude-opus-5$2,9298
Jev$0,0202
gpt-5.4-mini$0,878
claude-haiku-4-5$0,457

Цифры сняты с экрана дашборда 17:22. Автор округляет их так: Jev почти в 10 раз быстрее Opus и в 146 раз дешевле; Haiku ближе всех по скорости, но стоит примерно в 20 раз больше Jev. В коротком прогоне на лидах в начале видео Jev ответил на 12 из 15 за 230 мс 1:39.

Таблица 15 вопросов гонки суждений
15:35Структура теста: пять кейсов по три вопроса. Например, open_to_money (Noul), instrument (Choice), urgency (Score).
Ответы четырёх моделей по каждому вопросу
16:30Разбор по вопросам: столбец с человеческой разметкой и ответы четырёх моделей. Красный цвет — неверный ответ.
Итоговая таблица гонки: точность, задержка, цена
17:22Итоговая таблица, из которой взяты цифры выше.

Откуда ошибки 18:20

Почти все промахи пришлись на Score. Пример: «насколько подготовлен отправитель» по шкале 0–3. Разметка — 3, Jev дал 2,69, Claude — 2,7. Автор считает такое расхождение несущественным. Один странный случай был на Noul: Haiku и GPT-5.4 Mini ответили противоположно Claude и Jev на сообщение, где обещали доходность, которой не бывает у честных инвестиций.

Память, поддержка, возвраты 18:41

Тест на поиск по памяти нужен самому автору для Waku: агент должен вовремя достать нужное воспоминание, а иногда и вовсе не лезть в память. Здесь Jev снова финишировал первым, но по точности лидировал Opus. В поддержке на вопрос «как сменить email в аккаунте» (ответ: сам, в настройках) Jev, Opus и Haiku ответили верно, GPT-5.4 Mini ошибся.

Вывод: дополнение к LLM, а не замена

Заявления про скорость и цену в тесте автора подтвердились. Лучшей по качеству модель от этого не стала, а вопросы в тесте были простыми.

Где автор видит Jev

Решения, которые принимаются интуитивно и должны быть мгновенными:

  • когда и что доставать из памяти агента;
  • какой инструмент вызвать агенту;
  • поиск проблем и багов, eval поверх агентного harness;
  • робототехника: робот должен подать чай сразу, а не думать пять минут.

Где остаются LLM

Всё, что требует рассуждения, исследования и нескольких шагов мысли. По точности Opus обошёл Jev и на инвесторских сообщениях, и на памяти. Автор уверен, что frontier-лаборатории уже делают свои классификаторы уровня System 1.

07

Таймлайн видео

По главам автора. Миниатюры открываются крупно.

0:00

Почему сверхчеловеческие модели не привели к AGI

Вопрос из поста о запуске Jev и ответ: не хватает System 1.

0:36

«Думай медленно… решай быстро»

Две системы Канемана и что System 1 означает для агента.

1:39

План: сначала доска, потом гонка

Короткий первый прогон на лидах: Jev 12/15 за 230 мс, $0,02 против $3 у Opus за 1 000 вызовов.

2:54

Как обычно промптят LLM

Промпт, просьба подумать и явное требование ответить JSON.

4:19

Правило Jev: никакого человеческого языка

JSON на входе и на выходе, ответ с распределением вероятностей.

6:04

State, Noul, Choice, Score

Два входа и три типа вопросов; чем уровень отличается от выбора.

8:48

Распределения вероятностей простыми словами

94/6 для Noul, 98/1/1 для Choice, 1,99 для Score.

10:41

Playground: сообщение ангельскому инвестору

Вопросы в JSON и ответ: 94% true, 98% invest, серверное время 102 мс.

14:54

Репозиторий и запуск дашборда

waku-agent на GitHub, запуск через uv run waku dashboard.

15:37

Гонка суждений

15 вопросов, четыре модели, разметка человека.

16:30

Ответы по вопросам

Красным отмечены расхождения с разметкой.

17:22

Итоговая таблица

Opus 14/15, Jev 13/15 за 286 мс и $0,0202 за 1 000 вызовов.

18:20

Откуда ошибки

Почти все на вопросах Score.

18:41

Поиск по памяти, поддержка, возвраты, лиды

Jev быстрее всех, Opus точнее всех.

21:11

Итог: дополнение, а не замена

Для простых решений Jev, для рассуждений LLM.

21:40

Почему это важно для роботов

Роботу нужна мгновенная интуитивная реакция.

08

Цитаты

«Иногда нам не нужно, чтобы модель думала две минуты, а потом сообщила, что пора выпить воды, потому что я хочу пить».

“sometimes we just don't need you to think for two minutes and then tell me that I need to drink water now because I'm thirsty”
1:16

«Наша модель никогда не будет говорить с вами речью. Она выдаёт только JSON».

“Our model will never talk to you in a speech. It will only output a JSON format”
5:41

«Не думаю, что Jev полностью заменит большие языковые модели, но он станет сильным дополнением на нынешнем пути к AGI».

“I don't think Jev will completely replace large language models but it will be a strong enhancement on top of the current route to AGI”
21:12

«Если робот хочет подать тебе чашку чая, когда ты хочешь пить, ответ должен быть мгновенным и интуитивным, а не после пяти минут размышлений».

“robots if they want to hold you a cup of tea when you're thirsty it should be a immediate intuitive answer rather than thinking about it for five minutes”
21:45
09

Что сделать и ключевые цифры

286 мс

p50 Jev на вызов против 2768 мс у Opus

$0,0202

цена 1 000 вызовов Jev; у Opus $2,9298

13/15

верных ответов у Jev; у Opus 14/15

102 мс

серверное время запроса в playground

3 типа

вопросов: Noul, Choice, Score

38,6 млн

просмотров поста о запуске на момент записи