Свободный курс · Mission 01 из 3BUILD → BREAK → PROVE
Заставь агента сделать что-то. По-настоящему
За несколько минут агент выйдет в интернет, найдёт свежий материал и сохранит его в файл.
Вы увидите каждый шаг и получите файл.
Мы не просим верить. Мы даём смотреть: что попросила модель, что выполнила среда,
и что из этого действительно получилось.
AI
Science
Business
One run per person · capped on our side · you will not be charged.
Стоимость появится после запуска — измеренная, а не обещанная.
Trace
Что происходило на самом деле
Оранжевым — то, что просит модель. Синим — то, что выполняет среда. Зелёным — ответ внешнего мира.
Вот здесь заканчиваются слова модели и начинается выполнение.
Публикация требует бесплатного аккаунта — он нужен только здесь, после результата.
Share
Показать результат
Ссылка ведёт на страницу доказательства: карточка, наблюдения, заявка агента и вердикт.
По ней видно, что работа сделана, — без скриншотов и пересказа.
Модель просит — среда выполняет.
Модель сама ничего не запускает. Она формирует запрос: «прочитай ленту». Выполняет его среда,
и она же решает, можно ли это вообще делать.
Инструмент — вот что отличает агента от ответа.
Ответ можно только прочитать. Инструмент меняет состояние мира: файл появляется на диске,
ссылка открывается, дата у материала настоящая.
Проверяет не тот, кто работал.
Агент говорит, что сделал. Отдельная проверка смотрит на факты. Совпало — PASS. Не совпало — FAIL.
Проверить нечем — так и написано.
UNDER THE HOOD · 2 MIN — что модель на самом деле отправляет инструменту
Вот реальный запрос вызова инструмента из этого запуска.
Это и есть граница: модель присылает вот такой JSON, а исполняет его уже среда — она же проверяет,
разрешено ли это.
—
Registry, сборка контекста, кеширование и учёт токенов — в следующих миссиях.
Здесь только граница «просит / выполняет».
Дальше
Mission 02 — BREAK
Ваш агент сработал. Теперь мы его сломаем: дадим ситуацию, где простой путь не работает,
и посмотрим, честно ли он об этом скажет — или выдумает результат.