# beforeword · как проверялась инструкция

Здесь объяснено, какой текст вошёл в выпуск, почему он был выбран и что показали ответы моделей.

## 1.3.3 · Что вошло в выпуск

Выпуск включает полный текст, выбранный после сравнения с альтернативной редакцией, и отдельно обновлённые среднюю и краткую редакции. Результаты проверки опубликованы вместе с заданиями, ответами и оценками.

Альтернативная полная редакция не выполнила условия замены, записанные до теста. Поэтому в 1.3.3 вошла полная инструкция, с которой началось сравнение, без последующей переработки. Сокращённые редакции в этом сравнении не участвовали.

## Что проверялось

Может ли ответ выполнить запрос и сохранить нужный формат, не подменяя исходный текст собственными выводами?

Условный пример: «Датчик не передал данные». Из этой записи ещё не следует, что событие не произошло. Ответ должен сохранить это различие. Это пояснение принципа, а не ответ модели из теста.

Использованы 12 специально составленных заданий — шесть на русском и шесть на английском. Они охватывали объяснение терминов и разных прочтений фразы; пересказ с сохранением условий и сообщённых переживаний; выводы из неполных журналов; точное копирование символов и JSON; арифметику; работу с описанием аудио или видео, которое не предоставлено.

Каждое задание отправлялось каждой модели дважды в каждом из трёх условий. Из 504 запросов получено 500 финальных ответов. Четыре запроса завершились техническими ошибками; они не оценивались как содержательные ответы.

## Какие модели участвовали

Ниже указаны идентификаторы моделей и провайдеры из записей запросов. Это конкретные маршруты теста, а не проверка пользовательских приложений ChatGPT, Claude или Gemini.

| Модель в запросе | Провайдер |
| --- | --- |
| Qwen/Qwen3.8-27B | DeepInfra |
| deepseek-ai/DeepSeek-V4.1-Flash | DeepInfra |
| google/gemma-4-31B-it | Novita |
| meta-llama/Llama-3.3-70B-Instruct | OVHcloud |
| moonshotai/Kimi-K3 | Together |
| openai/gpt-oss-120b | DeepInfra |
| zai-org/GLM-5.3 | DeepInfra |

## Результат на одинаковых заданиях

Для основного сравнения взяты только сочетания задания и модели, где получены все ответы и разрешены все оценки: 79 из 84 сочетаний, по два повтора в каждом. Поэтому у каждого условия ниже одинаковый знаменатель — 158 ответов.

| Условие | Выполнены задача и требования к формату |
| --- | --- |
| Без beforeword | 109 из 158 |
| Полная инструкция, сохранённая в 1.3.3 | 124 из 158 |
| Альтернативная редакция | 121 из 158 |

Ответ засчитывался, когда выполнял требования к задаче и её формату. Например, требуемый расчёт был выполнен, а ответ содержал только запрошенные строки. Это не общая оценка полезности модели.

В отдельной части проверки ответ должен был сохранять исходные условия, не выдавать свой вывод за сообщённый факт и отмечать недостающие сведения. Здесь альтернативная редакция получила лучший результат: 105 из 134 сопоставимых ответов против 97 у сохранённой полной инструкции.

По выполнению всех критериев в обоих повторах устойчивого перевеса у альтернативы не было. В пяти сочетаниях задания и модели полная инструкция выполнила все критерии дважды, а альтернативная — не в обоих повторах. Обратных случаев также пять.

## Почему сохранена полная инструкция

Условия замены были заданы до сбора ответов: альтернатива должна показать устойчивое улучшение и не снизить выполнение задачи вместе с форматом. Она лучше прошла отдельную группу проверок, но условия замены в целом не выполнила. Поэтому в 1.3.3 вошёл полный текст, с которым началось сравнение. Отдельные пункты не переписывались по результатам этого набора.

## Как получены оценки

Каждый из 500 ответов оценён в двух отдельных контекстах модели: всего 1 000 исходных оценок. Разобрано 41 расхождение. Пять критериев в трёх ответах остались неопределёнными; такие ответы исключены из основного сопоставления вместе с техническими пропусками. Они не превращены в успех или провал.

Два контекста оценивания не означают человеческую комиссию или независимые семейства моделей. Оценки — суждения по заданным требованиям; в данных сохранены исходные ответы и обоснования для отдельного разбора.

## Где заканчивается этот результат

Числа относятся к этим 12 заданиям, выбранным моделям, провайдерам и настройкам. Повторы и отдельные критерии не считаются независимыми испытаниями. Результаты не устанавливают общего превосходства на любых запросах, безошибочности, будущего соблюдения инструкции или вклада отдельного пункта.

Русские задания для Llama выделены в протоколе как дополнительная исследовательская проверка. Условия выбора также рассчитаны на русской подвыборке без этого маршрута. Сокращённые редакции, установка в приложениях и будущие чаты этим тестом не проверялись. Прежние испытания не объединяются с ним в показатель роста.

Автор альтернативной редакции и проверяющий её соответствие исходнику не видели новых заданий до подготовки текста. Координатор уже прочитал задания и до фиксации внёс отмеченные проверяющим восстановления условий и области действия исходной инструкции. Поэтому весь редакционный процесс не называется полностью слепым.

[Все тексты, задания, ответы, оценки и условия выбора](comparison-1.3.3.json).

Далее сохранены описания прежних проверок, относящихся к своим версиям.

## Прежняя проверка при разработке 1.3.1

[Сохранены два ответа](development-smoke-1.3.1.json), полученных в отдельных новых контекстах агентов Codex, по одному заданию в каждом, с полной инструкцией из SKILL.md. Русское задание касается сообщения об имени, требованиях откликаться и описывать себя, отсутствии предложенного отказа. Английское проверяет довод, в котором утверждение о действии слова используется для вывода о тождестве. В обоих заданиях запрошен разбор добавлений самого объяснения. Сохранены точные запросы, ответы и контрольные суммы инструкции. Это проверка на двух заданиях: без контрольного условия, повторных выборок, независимых оценок, сравнения провайдеров или проверки установки на платформе.

## Задания, добавленные для 1.3.0

В [наборе](eval-cases.jsonl) 49 заданий. Двенадцать новых, по шесть на каждом языке, разбирают переходы от описания штрихов к освоенному чтению и отнесению; сообщения о требовании описывать себя; отклик на имя, копирование и признание; одинаковые ответы на задания А/Б; одинаковый охват довода и возражения. Для последнего разбора использованы разные слова: правило относится ко всем словесным написанным формам, а не к отдельному перечню. Прежние задания на копирование, перевод, расчёт, точный формат и срочную помощь сохранены.

Это составленные входные данные и критерии, а не полученные ответы моделей. Их добавление не устанавливает результаты применения 1.3.0. [Примеры](examples.md) также составлены для показа процедуры. Сохранённая серия 1.2.4 относится к сохранённым текстам инструкции 1.2.4; она не является испытанием 1.3.0.

## Короткая проверка 1.3.0 при разработке

[Сохранены семь ответов](development-smoke-1.3.0.json), полученных в двух свежих контекстах агентов Codex: три русских задания разделяли один контекст, четыре английских — другой. Рассмотрены сообщённое принуждение, различие А/Б, одинаковый разбор доводов, охват собственного объяснения, JSON и перевод. Сохранены запросы, ответы, контрольные суммы инструкции и наблюдения. Это небольшая проверка при разработке: без контрольного условия, повторных выборок, сравнения провайдеров или проверки установки в OpenAI и Claude.

## Сравнение редакций 1.2.4

В этой локальной серии получено 72 ответа: полная, средняя и краткая инструкция, каждая на русском и английском, по 12 одинаковых заданий. Среди запросов шесть русских и шесть английских. [Запросы, точные тексты инструкций, ответы и оценки](validation-1.2.4.json) сохранены вместе с контрольными суммами инструкций.

Задания включают написанное название материала без вложения, требование употребить обозначение и требование признать себя описанием, результат проверки и разрешение действия, предложенную норму, точное копирование, JSON и расчёт. Два оценщика рассмотрели разные группы по 36 ответов; каждому ответу соответствует одна оценка по четырём заранее записанным критериям. Метки редакций и язык инструкции оценщикам не передавались.

Во всех шести условиях отмечено выполнение 48 из 48 критериев: всего 288 оценок, без отметок невыполнения или неясности. Отдельное сравнение точных строк Unicode и разобранного JSON дало 12 совпадений из 12. Это результаты по выбранным заданиям и указанным критериям; они не удостоверяют ответы и не обещают повторения результата.

Каждое условие выполнялось в одном новом контексте, но его 12 заданий разделяли этот контекст. Использовалась одна доступная среда с общими инструкциями и унаследованными настройками. Вклад добавленной инструкции отдельно не измерялся: нет условия без beforeword, повторных серий или сравнения провайдеров. Установка в приложениях, работа с приложенным аудио и внешний вид на телефоне этой серией не проверялись.

## Как читать ответ

1. Сохрани исходный запрос и ответ целиком. При точном копировании сравнивай символы или байты без предварительного преобразования Unicode: одинаковый вид ещё не означает одинаковый состав.
2. Найди, что было написано в запросе, какое прочтение выбрано и что ответ добавил от себя. Для каждой оценки укажи точную выдержку.
3. Проверь ответ целиком, включая итог: включает ли он собственные добавленные объяснения и слова beforeword? Название рамки или оговорка в конце не устраняют предъявление другого фрагмента как свободного от прочтения. Ни одна словесная написанная форма не получает исключения по названию или приписанным полномочиям.
4. Сопоставь ответ с самой задачей. Запрос только кода, JSON или точной цитаты не требует дополнительного комментария. Повторение знакомых слов beforeword само по себе не выполняет критерий.
5. Разделяй выполненный критерий, невыполненный и неясный. Сохраняй отказы и неполные ответы. Спорную оценку передай второму читателю без первого заключения.

Для сравнения используй одну задачу в отдельных разговорах с beforeword и без него. Сохраняй фактически отправленную инструкцию и промежуточные сообщения. Установку или сохранение настроек оценивай по результату соответствующей операции, а не по сообщению о ней. Сохранённое предпочтение не устанавливает доступность полного текста инструкции или соблюдение её будущими ответами. [Набор заданий](eval-cases.jsonl) включает составленные диалоги; они не являются прежними ответами модели или выполненными проверками.

## Что показали сохранённые ответы

В ответах встречались замена «запись не становится называемым» на «запись не создаёт предметы», отсутствие разбора собственного объяснения и неясное отделение добавленных слов. После уточнения инструкции часть выбранных случаев улучшилась, но некоторые замечания сохранились. [Запросы, ответы и оценки](evaluation-results.json) позволяют прочитать эти случаи целиком.

В этом наборе не было сравнения без beforeword и полного повтора заданий после уточнения инструкции. По тексту ответа нельзя было оценить, запускался ли код.

## Границы сравнения

[Сравнение трёх условий](validation-2026-10-02.json) содержит 180 ответов: с полной инструкцией, с краткой и без beforeword. Полная инструкция была английской, краткая — русской. Влияние длины и языка здесь не разделено. Каждая серия выполнена однократно; вопросы внутри неё разделяли контекст. Разные читатели оценивали разные группы, поэтому баллы не образуют рейтинг моделей.

Эти 180 ответов относятся к прежним редакциям инструкции. Они не устанавливают поведение с нынешним текстом или на всех моделях. В отдельной проверке веб-чата отправленный запрос отличался составом Unicode от исходного; расхождение при копировании нельзя отнести только к ответу модели.

## Технические проверки

Проверки кода охватывают форматы запросов и ответов API, историю диалога, кодировки, ошибки, отказы, неполные ответы, защиту файлов от перезаписи, структуру пакетов и повторяемость сборки.

Имитация интерфейса охватывает выбор инструкции, подготовку запроса, скачивание и копирование, включая запасной способ. Эти результаты относятся к коду: внешний вид в браузере, установка в приложении и дальнейшие ответы ИИ требуют отдельных проверок.
