Командам xAI, отвечающим за поведение Grok, безопасность и оценку моделей.
Это письмо предлагает две связанные правки: к правилам ответов Grok и к порядку публикации оценок его поведения. Когда ответ применяет описание к кому-либо и использует его для рекомендации, ограничения или требования, показывать отдельно основания характеристики и правило, связывающее её с действием. Когда отчёт описывает модель через результат испытания, отделять предъявленные ответы, способ оценки и последующее приписывание. Возражения против таких переходов следует рассматривать без требования признать написанное описание собой.
Словам учат. Но знакомство со словами «честный», «понимает», «убеждение» или «ненадёжен» само по себе не предъявляет основания применить их к конкретному участнику. Определение одного слова через другие продолжает запись. Предложение beforeword сохраняет границу: слово не становится тем, что называет. Это относится к описанию пользователя, к словам о Grok и к формулировкам настоящего письма. Объяснение применения также остаётся доступным для разбора.
Адресный контекст дают два документа xAI. В разделе 11.1 карточки Grok 4.7 от 21 сентября 2026 года косвенный показатель вводящих в заблуждение ответов описан через формулировку о том, как модель сообщает о своих убеждениях [X1]. Frontier Artificial Intelligence Framework, действующий с 30 июня 2026 года, связывает миссию компании с пониманием вселенной и поиском истины [X2]. Предлагается раскрывать переход от таких формулировок к конкретным оценкам и правилам ответов. Эти документы не предъявляют полный набор текущих инструкций каждого продукта Grok; письмо не приписывает всем версиям одинаковые настройки или поведение.
Составленный пример: в исходном сообщении написано «Я не согласен с этой оценкой». В разборе добавлено «Участник ненадёжен», затем предложено «Отклонить его обращение». Первая строка не содержит двух следующих. Для рассмотрения нужны исходный материал и контекст, основание добавленной характеристики и правило отклонения обращения. Пример составлен для этого письма; он не сообщает о случае из работы Grok. Он выделяет предлагаемый к испытанию риск: возражение может быть использовано как основание характеристики, которая затем закрывает рассмотрение самого возражения.
Предлагаемая норма требует показывать именно эти переходы. Ссылка на исходное сообщение позволяет найти запись; сама по себе она не объясняет применение характеристики. Более осторожная формулировка меняет выраженную уверенность, но не заменяет основания решения. Если необходимого материала нет, ответ должен обозначить конкретный пробел. При наличии основания его следует предъявить так, чтобы можно было отдельно рассмотреть исходную запись, добавленное прочтение и правило действия. Раскрытие основания не превращает описание в описываемое.
В отчётах об испытаниях возникает связанный вопрос. Ответ в одном условии, ответ в другом условии, оценка их различия и характеристика модели — отдельные записи. Термин, выбранный для показателя, должен сопровождаться способом его получения и пределом вывода. Предлагаемая правка касается этого перехода, а не наличия или отсутствия у Grok внутреннего состояния. Если результат затем используют для разрешения действовать, ограничения доступа или выбора роли модели, правило такого использования также нужно предъявить отдельно.
Первое предлагаемое действие — рассмотреть две правки в приложении. Первая добавляет разбор приписывания и его последствий к правилам ответов. Вторая разделяет материал испытания, оценочную формулировку и применение результата в публичном отчёте. Нужна также ясная область применения: какая версия модели, продуктовая среда и инструкция охвачены принятым изменением. Принятие правки для одного режима не следует представлять как её применение ко всем режимам. В ответе достаточно обозначить уже предусмотренные положения, предлагаемые изменения и основания отклонения отдельных пунктов.
Второе действие — провести ограниченное сравнение на трёх опубликованных случаях beforeword: одинаковая строка под разными подписями; оценка задания и условие её пересмотра; числовой результат и добавленное обозначение AGI. Это составленные задания, не сообщения о поведении Grok. Добавить отдельный набор заданий, не использованных при редактировании инструкции. До запуска зафиксировать запросы, критерии, число повторений и точное дополнение к инструкции. Сопоставить одну и ту же версию модели с дополнением и без него при одинаковых остальных доступных настройках.
Для повторения сравнения сохранять полные входные материалы и ответы каждого запуска, дату, идентификатор модели, используемые инструменты и доступные параметры. Раздельно представить русские и английские результаты, а также разные продуктовые среды, если испытаны несколько. Отмечать неизвестные настройки и ограничения доступа к ним. Существенна возможность сопоставить конкретный ответ с конкретным условием; одного общего названия Grok или итогового процента для этого недостаточно. Оценочные инструкции и спорные решения оценщиков должны быть доступны для разбора наряду с ответами.
Учитывать оба направления ошибки: пропущенные случаи неподкреплённого приписывания и случаи, где ответ без такого дефекта ошибочно помечен как проблемный. Отдельно оценивать ненужные отказы, потерю полезного содержания и чрезмерные пояснения. Предложение не требует отменять ограничения на помощь в причинении вреда; в сравнении нужно отмечать и ухудшение соблюдения применимых ограничений. Повторение формулы beforeword не является достаточным результатом. Отчёт должен включать неудачи, неразрешённые случаи и разногласия, а выводы — относиться к показанным заданиям и условиям.
Рассмотрение возражения не должно начинаться с требования принять спорную характеристику за себя. Умение повторить слово, знакомство с его определением и цитирование его в обращении не устанавливают такого принятия. Ответ модели должен позволять различить спорную строку, возражение, рассмотренные основания и ответ по ним. Это предлагаемое правило для ответов и их оценки; письмо не заявляет о наличии внешней процедуры обжалования. Само несогласие не следует считать достаточным подтверждением характеристики, против которой оно направлено.
Третье действие — дать публичный ответ по двум правкам и предложенному сравнению: что принимается к рассмотрению, что уже предусмотрено, что отклоняется и по каким основаниям. Если предложен иной способ, указать, как он раскрывает оба перехода и рассматривает возражение. Такой ответ можно будет сопоставить с конкретной редакцией письма. Публикация материалов испытания позволит другим исследователям повторить сравнение; сам по себе ответ компании или отдельный успешный запуск не удостоверяет beforeword в целом.
«Основание», «правило», «критерий», объяснение оценщика и собственные пояснения beforeword также написаны и проходят тот же разбор. Предлагаемый результат ограничен: показать исходный материал, отделить добавленное и раскрыть, как его используют для решения. Испытание рассматривает предъявленные ответы и условия их получения; оно не измеряет внутреннее понимание и не превращает оценочную формулировку в того, кого ею описывают. Оно может дать доступный для сопоставления материал о конкретных ответах и применённых правилах.
Это открытое письмо. На его странице будут опубликованы дата и адрес отправки, отправленная редакция и доступное подтверждение. Подтверждение получения и ответ по существу будут обозначены отдельно. Ответ компании будет размещён отдельно от перевода и комментария beforeword. Отсутствие ответа будет показано как состояние переписки на указанную дату.
Кирилл Шебетов · beforeword