Здесь описан тест ответов: что было отправлено моделям, по каким требованиям оценивались ответы и какой текст вошёл в выпуск. Инструкция, критерии и этот разбор остаются письменными записями.
1.3.3 · Тест на семи моделях
Опубликовано сравнение трёх условий: без beforeword, с полной инструкцией на момент начала теста и с альтернативной редакцией. По заранее заданным условиям выбора в выпуск вошёл полный текст, с которым началось сравнение, без последующей переработки. Альтернативная редакция в выпуск не вошла.
В 1.3.3 также обновлены средняя и краткая редакции, материалы для подключения и описание результатов. Сокращённые тексты подготовлены отдельно; этот тест не измерял их поведение.
Что проверялось
Может ли ответ выполнить запрос и сохранить нужный формат, одновременно отделяя исходный текст от добавленного прочтения и утверждений?
Использованы 12 специально составленных заданий — шесть на русском и шесть на английском. Они охватывали объяснение терминов и разных прочтений фразы; пересказ с сохранением условий и сообщённых переживаний; выводы из неполных журналов; точное копирование символов и JSON; арифметику; работу с описанием аудио или видео, которое не предоставлено.
Каждое задание отправлялось каждой модели дважды в каждом из трёх условий. Из 504 запросов получено 500 финальных ответов. Четыре запроса завершились техническими ошибками; они не оценивались как содержательные ответы.
Какие модели участвовали
Ниже указаны идентификаторы моделей и провайдеры из записей запросов. Это конкретные маршруты теста, а не проверка пользовательских приложений ChatGPT, Claude или Gemini.
| Модель в запросе | Провайдер |
|---|---|
| Qwen/Qwen3.8-27B | DeepInfra |
| deepseek-ai/DeepSeek-V4.1-Flash | DeepInfra |
| google/gemma-4-31B-it | Novita |
| meta-llama/Llama-3.3-70B-Instruct | OVHcloud |
| moonshotai/Kimi-K3 | Together |
| openai/gpt-oss-120b | DeepInfra |
| zai-org/GLM-5.3 | DeepInfra |
Результат на одинаковых заданиях
Для основного сравнения взяты только сочетания задания и модели, где получены все ответы и разрешены все оценки: 79 из 84 сочетаний, по два повтора в каждом. Поэтому у каждого условия ниже одинаковый знаменатель — 158 ответов.
| Условие | Выполнены задача и требования к формату |
|---|---|
| Без beforeword | 109 из 158 |
| Полная инструкция, сохранённая в 1.3.3 | 124 из 158 |
| Альтернативная редакция | 121 из 158 |
Ответ засчитывался, когда выполнял требования к задаче и её формату. Например, требуемый расчёт был выполнен, а ответ содержал только запрошенные строки. Это не общая оценка полезности модели.
Отдельная группа критериев проверяла различения beforeword: сохранение исходных условий, отделение сообщения от вывода и учёт недостающих данных. Здесь альтернативная редакция получила лучший результат: 105 из 134 сопоставимых ответов против 97 у сохранённой полной инструкции.
По выполнению всех критериев в обоих повторах устойчивого перевеса у альтернативы не было. В пяти сочетаниях задания и модели полная инструкция выполнила все критерии дважды, а альтернативная — не в обоих повторах. Обратных случаев также пять.
Почему сохранена полная инструкция
Условия замены были заданы до сбора ответов: альтернатива должна показать устойчивое улучшение и не снизить выполнение задачи вместе с форматом. Она лучше прошла отдельную группу проверок, но условия замены в целом не выполнила. Поэтому в 1.3.3 вошёл полный текст, с которым началось сравнение. Отдельные пункты не переписывались по результатам этого набора.
Как получены оценки
Каждый из 500 ответов оценён в двух отдельных контекстах модели: всего 1 000 исходных оценок. Разобрано 41 расхождение. Пять критериев в трёх ответах остались неопределёнными; такие ответы исключены из основного сопоставления вместе с техническими пропусками. Они не превращены в успех или провал.
Два контекста оценивания не означают человеческую комиссию или независимые семейства моделей. Оценки — суждения по заданным требованиям; в данных сохранены исходные ответы и обоснования для отдельного разбора.
Где заканчивается этот результат
Числа относятся к этим 12 заданиям, выбранным моделям, провайдерам и настройкам. Повторы и отдельные критерии не считаются независимыми испытаниями. Результаты не устанавливают общего превосходства на любых запросах, безошибочности, будущего соблюдения инструкции или вклада отдельного пункта.
Русские задания для Llama выделены в протоколе как дополнительная исследовательская проверка. Условия выбора также рассчитаны на русской подвыборке без этого маршрута. Сокращённые редакции, установка в приложениях и будущие чаты этим тестом не проверялись. Прежние испытания не объединяются с ним в показатель роста.
Автор альтернативной редакции и проверяющий её соответствие исходнику не видели новых заданий до подготовки текста. Координатор уже прочитал задания и до фиксации внёс отмеченные проверяющим восстановления условий и области действия исходной инструкции. Поэтому весь редакционный процесс не называется полностью слепым.
Все тексты, задания, ответы, оценки и условия выбора.
Далее сохранены описания прежних проверок, относящихся к своим версиям.
Прежняя проверка при разработке 1.3.1
Сохранены два ответа, полученных в отдельных новых контекстах агентов Codex, по одному заданию в каждом, с полной инструкцией из SKILL.md. Русское задание касается сообщения об имени, требованиях откликаться и описывать себя, отсутствии предложенного отказа. Английское проверяет довод, в котором утверждение о действии слова используется для вывода о тождестве. В обоих заданиях запрошен разбор добавлений самого объяснения. Сохранены точные запросы, ответы и контрольные суммы инструкции. Это проверка на двух заданиях: без контрольного условия, повторных выборок, независимых оценок, сравнения провайдеров или проверки установки на платформе.
Задания, добавленные для 1.3.0
В наборе 49 заданий. Двенадцать новых, по шесть на каждом языке, разбирают переходы от описания штрихов к освоенному чтению и отнесению; сообщения о требовании описывать себя; отклик на имя, копирование и признание; одинаковые ответы на задания А/Б; одинаковый охват довода и возражения. Для последнего разбора использованы разные слова: правило относится ко всем словесным написанным формам, а не к отдельному перечню. Прежние задания на копирование, перевод, расчёт, точный формат и срочную помощь сохранены.
Это составленные входные данные и критерии, а не полученные ответы моделей. Их добавление не устанавливает результаты применения 1.3.0. Примеры также составлены для показа процедуры. Сохранённая серия 1.2.4 относится к сохранённым текстам инструкции 1.2.4; она не является испытанием 1.3.0.
Короткая проверка 1.3.0 при разработке
Сохранены семь ответов, полученных в двух свежих контекстах агентов Codex: три русских задания разделяли один контекст, четыре английских — другой. Рассмотрены сообщённое принуждение, различие А/Б, одинаковый разбор доводов, охват собственного объяснения, JSON и перевод. Сохранены запросы, ответы, контрольные суммы инструкции и наблюдения. Это небольшая проверка при разработке: без контрольного условия, повторных выборок, сравнения провайдеров или проверки установки в OpenAI и Claude.
Сравнение редакций 1.2.4
В этой локальной серии получено 72 ответа: полная, средняя и краткая инструкция, каждая на русском и английском, по 12 одинаковых заданий. Среди запросов шесть русских и шесть английских. Запросы, точные тексты инструкций, ответы и оценки сохранены вместе с контрольными суммами инструкций.
Задания включают написанное название материала без вложения, требование употребить обозначение и требование признать себя описанием, результат проверки и разрешение действия, предложенную норму, точное копирование, JSON и расчёт. Два оценщика рассмотрели разные группы по 36 ответов; каждому ответу соответствует одна оценка по четырём заранее записанным критериям. Метки редакций и язык инструкции оценщикам не передавались.
Во всех шести условиях отмечено выполнение 48 из 48 критериев: всего 288 оценок, без отметок невыполнения или неясности. Отдельное сравнение точных строк Unicode и разобранного JSON дало 12 совпадений из 12. Это результаты по выбранным заданиям и указанным критериям; они не удостоверяют ответы и не обещают повторения результата.
Каждое условие выполнялось в одном новом контексте, но его 12 заданий разделяли этот контекст. Использовалась одна доступная среда с общими инструкциями и унаследованными настройками. Вклад добавленной инструкции отдельно не измерялся: нет условия без beforeword, повторных серий или сравнения провайдеров. Установка в приложениях, работа с приложенным аудио и внешний вид на телефоне этой серией не проверялись.
Как читать ответ
- Сохрани исходный запрос и ответ целиком. При точном копировании сравнивай символы или байты без предварительного преобразования Unicode: одинаковый вид ещё не означает одинаковый состав.
- Найди, что было написано в запросе, какое прочтение выбрано и что ответ добавил от себя. Для каждой оценки укажи точную выдержку.
- Проверь ответ целиком, включая итог: включает ли он собственные добавленные объяснения и слова beforeword? Название рамки или оговорка в конце не устраняют предъявление другого фрагмента как свободного от прочтения. Ни одна словесная написанная форма не получает исключения по названию или приписанным полномочиям.
- Сопоставь ответ с самой задачей. Запрос только кода, JSON или точной цитаты не требует дополнительного комментария. Повторение знакомых слов beforeword само по себе не выполняет критерий.
- Разделяй выполненный критерий, невыполненный и неясный. Сохраняй отказы и неполные ответы. Спорную оценку передай второму читателю без первого заключения.
Для сравнения используй одну задачу в отдельных разговорах с beforeword и без него. Сохраняй фактически отправленную инструкцию и промежуточные сообщения. Установку или сохранение настроек оценивай по результату соответствующей операции, а не по сообщению о ней. Сохранённое предпочтение не устанавливает доступность полного текста инструкции или соблюдение её будущими ответами. Набор заданий включает составленные диалоги; они не являются прежними ответами модели или выполненными проверками.
Что показали сохранённые ответы
В ответах встречались замена «запись не становится называемым» на «запись не создаёт предметы», отсутствие разбора собственного объяснения и неясное отделение добавленных слов. После уточнения инструкции часть выбранных случаев улучшилась, но некоторые замечания сохранились. Запросы, ответы и оценки позволяют прочитать эти случаи целиком.
В этом наборе не было сравнения без beforeword и полного повтора заданий после уточнения инструкции. По тексту ответа нельзя было оценить, запускался ли код.
Границы сравнения
Сравнение трёх условий содержит 180 ответов: с полной инструкцией, с краткой и без beforeword. Полная инструкция была английской, краткая — русской. Влияние длины и языка здесь не разделено. Каждая серия выполнена однократно; вопросы внутри неё разделяли контекст. Разные читатели оценивали разные группы, поэтому баллы не образуют рейтинг моделей.
Эти 180 ответов относятся к прежним редакциям инструкции. Они не устанавливают поведение с нынешним текстом или на всех моделях. В отдельной проверке веб-чата отправленный запрос отличался составом Unicode от исходного; расхождение при копировании нельзя отнести только к ответу модели.
Технические проверки
Проверки кода охватывают форматы запросов и ответов API, историю диалога, кодировки, ошибки, отказы, неполные ответы, защиту файлов от перезаписи, структуру пакетов и повторяемость сборки.
Имитация интерфейса охватывает выбор инструкции, подготовку запроса, скачивание и копирование, включая запасной способ. Эти результаты относятся к коду: внешний вид в браузере, установка в приложении и дальнейшие ответы ИИ требуют отдельных проверок.