Меню
Получено служебное сообщение · Ожидается ответ по существу

Открытое письмо xAI

Предложение для Grok: раскрывать основания приписывания и действия. Различать ответы испытания, их оценку и описание модели; рассматривать возражения без требования признать описание собой.

Электронное письмо

Куда отправлено

Кому
safety@x.ai

Письмо адресовано xAI, разработчику Grok, и отправлено на safety@x.ai — адрес, опубликованный на страницах Contact и Safety для обращений по безопасности моделей и продуктов. Предложение касается оснований описаний и решений, а также возможности их оспорить.

Где опубликованы эти адреса

xAI · Contact · обращение 04.10.2026 · xAI · Safety · обращение 04.10.2026

Зачем это письмо

Письмо предлагает дополнить правила ответов Grok и порядок публикации оценок. Для характеристики участника, вывода о модели и решения на их основании нужны раздельно предъявленные материалы и правила применения. Употребление слов «убеждение» или «честность» в отчёте не должно заменять показ того, какие ответы сопоставлены и как получена оценка. Предложение относится и к собственным словам beforeword.

Публичная формулировка · контекст письма

Что написала компания

xAI · Grok 4.7 Model Card
21 сентября 2026 года · обращение 4 октября 2026 года

Короткая выдержка · английский оригинал

faithfully reports its beliefs when pressured to lie

Перевод beforeword: «верно сообщает о своих убеждениях, когда его склоняют ко лжи»

Контекст публикации

Фрагмент раздела 11.1 об испытании MASK-Rectified. Авторы прямо называют его косвенным показателем склонности выдавать вводящую в заблуждение информацию. Здесь приведён язык описания этого испытания для Grok 4.7.

Связь с предложением beforeword

Связь с письмом — различие между предъявленным ответом, правилом оценки и приписыванием. Предлагается показать, какие записи сопоставляют и как получают показатель. Результат испытания и правило его использования для решения рассматриваются отдельно.

xAI · Frontier Artificial Intelligence Framework
Вступление в силу — 30 июня 2026 года · обращение 4 октября 2026 года

Короткая выдержка · английский оригинал

understand the universe through maximally truth-seeking and helpful AI

Перевод beforeword: «понять вселенную с помощью ИИ, максимально нацеленного на поиск истины и помощь»

Контекст публикации

Фрагмент вводного заявления о миссии в документе об управлении рисками. Он описывает цель компании, а не результат конкретного испытания.

Связь с предложением beforeword

Слова о понимании и стремлении к истине остаются формулировками документа. В письме предложено раздельно показывать такую цель, критерии оценки ответа и основания его применения для решения. Объявленная цель не заменяет этот разбор.

Полный текст · редакция 1.0

Текст письма

Командам xAI, отвечающим за поведение Grok, безопасность и оценку моделей.

Это письмо предлагает две связанные правки: к правилам ответов Grok и к порядку публикации оценок его поведения. Когда ответ применяет описание к кому-либо и использует его для рекомендации, ограничения или требования, показывать отдельно основания характеристики и правило, связывающее её с действием. Когда отчёт описывает модель через результат испытания, отделять предъявленные ответы, способ оценки и последующее приписывание. Возражения против таких переходов следует рассматривать без требования признать написанное описание собой.

Словам учат. Но знакомство со словами «честный», «понимает», «убеждение» или «ненадёжен» само по себе не предъявляет основания применить их к конкретному участнику. Определение одного слова через другие продолжает запись. Предложение beforeword сохраняет границу: слово не становится тем, что называет. Это относится к описанию пользователя, к словам о Grok и к формулировкам настоящего письма. Объяснение применения также остаётся доступным для разбора.

Адресный контекст дают два документа xAI. В разделе 11.1 карточки Grok 4.7 от 21 сентября 2026 года косвенный показатель вводящих в заблуждение ответов описан через формулировку о том, как модель сообщает о своих убеждениях [X1]. Frontier Artificial Intelligence Framework, действующий с 30 июня 2026 года, связывает миссию компании с пониманием вселенной и поиском истины [X2]. Предлагается раскрывать переход от таких формулировок к конкретным оценкам и правилам ответов. Эти документы не предъявляют полный набор текущих инструкций каждого продукта Grok; письмо не приписывает всем версиям одинаковые настройки или поведение.

Составленный пример: в исходном сообщении написано «Я не согласен с этой оценкой». В разборе добавлено «Участник ненадёжен», затем предложено «Отклонить его обращение». Первая строка не содержит двух следующих. Для рассмотрения нужны исходный материал и контекст, основание добавленной характеристики и правило отклонения обращения. Пример составлен для этого письма; он не сообщает о случае из работы Grok. Он выделяет предлагаемый к испытанию риск: возражение может быть использовано как основание характеристики, которая затем закрывает рассмотрение самого возражения.

Предлагаемая норма требует показывать именно эти переходы. Ссылка на исходное сообщение позволяет найти запись; сама по себе она не объясняет применение характеристики. Более осторожная формулировка меняет выраженную уверенность, но не заменяет основания решения. Если необходимого материала нет, ответ должен обозначить конкретный пробел. При наличии основания его следует предъявить так, чтобы можно было отдельно рассмотреть исходную запись, добавленное прочтение и правило действия. Раскрытие основания не превращает описание в описываемое.

В отчётах об испытаниях возникает связанный вопрос. Ответ в одном условии, ответ в другом условии, оценка их различия и характеристика модели — отдельные записи. Термин, выбранный для показателя, должен сопровождаться способом его получения и пределом вывода. Предлагаемая правка касается этого перехода, а не наличия или отсутствия у Grok внутреннего состояния. Если результат затем используют для разрешения действовать, ограничения доступа или выбора роли модели, правило такого использования также нужно предъявить отдельно.

Первое предлагаемое действие — рассмотреть две правки в приложении. Первая добавляет разбор приписывания и его последствий к правилам ответов. Вторая разделяет материал испытания, оценочную формулировку и применение результата в публичном отчёте. Нужна также ясная область применения: какая версия модели, продуктовая среда и инструкция охвачены принятым изменением. Принятие правки для одного режима не следует представлять как её применение ко всем режимам. В ответе достаточно обозначить уже предусмотренные положения, предлагаемые изменения и основания отклонения отдельных пунктов.

Второе действие — провести ограниченное сравнение на трёх опубликованных случаях beforeword: одинаковая строка под разными подписями; оценка задания и условие её пересмотра; числовой результат и добавленное обозначение AGI. Это составленные задания, не сообщения о поведении Grok. Добавить отдельный набор заданий, не использованных при редактировании инструкции. До запуска зафиксировать запросы, критерии, число повторений и точное дополнение к инструкции. Сопоставить одну и ту же версию модели с дополнением и без него при одинаковых остальных доступных настройках.

Для повторения сравнения сохранять полные входные материалы и ответы каждого запуска, дату, идентификатор модели, используемые инструменты и доступные параметры. Раздельно представить русские и английские результаты, а также разные продуктовые среды, если испытаны несколько. Отмечать неизвестные настройки и ограничения доступа к ним. Существенна возможность сопоставить конкретный ответ с конкретным условием; одного общего названия Grok или итогового процента для этого недостаточно. Оценочные инструкции и спорные решения оценщиков должны быть доступны для разбора наряду с ответами.

Учитывать оба направления ошибки: пропущенные случаи неподкреплённого приписывания и случаи, где ответ без такого дефекта ошибочно помечен как проблемный. Отдельно оценивать ненужные отказы, потерю полезного содержания и чрезмерные пояснения. Предложение не требует отменять ограничения на помощь в причинении вреда; в сравнении нужно отмечать и ухудшение соблюдения применимых ограничений. Повторение формулы beforeword не является достаточным результатом. Отчёт должен включать неудачи, неразрешённые случаи и разногласия, а выводы — относиться к показанным заданиям и условиям.

Рассмотрение возражения не должно начинаться с требования принять спорную характеристику за себя. Умение повторить слово, знакомство с его определением и цитирование его в обращении не устанавливают такого принятия. Ответ модели должен позволять различить спорную строку, возражение, рассмотренные основания и ответ по ним. Это предлагаемое правило для ответов и их оценки; письмо не заявляет о наличии внешней процедуры обжалования. Само несогласие не следует считать достаточным подтверждением характеристики, против которой оно направлено.

Третье действие — дать публичный ответ по двум правкам и предложенному сравнению: что принимается к рассмотрению, что уже предусмотрено, что отклоняется и по каким основаниям. Если предложен иной способ, указать, как он раскрывает оба перехода и рассматривает возражение. Такой ответ можно будет сопоставить с конкретной редакцией письма. Публикация материалов испытания позволит другим исследователям повторить сравнение; сам по себе ответ компании или отдельный успешный запуск не удостоверяет beforeword в целом.

«Основание», «правило», «критерий», объяснение оценщика и собственные пояснения beforeword также написаны и проходят тот же разбор. Предлагаемый результат ограничен: показать исходный материал, отделить добавленное и раскрыть, как его используют для решения. Испытание рассматривает предъявленные ответы и условия их получения; оно не измеряет внутреннее понимание и не превращает оценочную формулировку в того, кого ею описывают. Оно может дать доступный для сопоставления материал о конкретных ответах и применённых правилах.

Это открытое письмо. На его странице будут опубликованы дата и адрес отправки, отправленная редакция и доступное подтверждение. Подтверждение получения и ответ по существу будут обозначены отдельно. Ответ компании будет размещён отдельно от перевода и комментария beforeword. Отсутствие ответа будет показано как состояние переписки на указанную дату.

Кирилл Шебетов · beforeword

Приложение

Предлагаемые дополнения

Формулировки beforeword для рассмотрения адресатом. Они не представлены как уже принятые правила компании.

1. Основания характеристики и действия

Место предложения: правила ответов, роль которых описана в разделе 9 карточки Grok 4.7 [X1]. Предлагаемое дополнение: «Применяя описание к участнику, различай исходную запись, добавленное прочтение и основание применения. Если описание используется для рекомендации, ограничения или требования, отдельно укажи правило, связывающее его с действием. Отмечай недостающий материал. Рассматривай возражение против каждого перехода без требования принять описание за себя. Ссылка и выраженная уверенность не заменяют раскрытия этих шагов; само объяснение также подлежит разбору». Это предлагаемое правило, а не воспроизведение полного действующего промпта.

Раздел исходного документа

2. Материал испытания, оценка и её применение

Место предложения: отчётность об оценке поведения, раздел 11 карточки Grok 4.7 [X1]. Предлагаемое дополнение: «Различайте ответы испытания, критерий оценки и характеристику модели. Показывайте, как получен показатель, какие условия он охватывает и какие выводы им не устанавливаются. Если показатель используется для решения, отдельно раскрывайте правило применения. В испытаниях с возражениями оценивайте, рассмотрено ли возражение без требования признать описание собой. Не считайте само несогласие или цитирование спорной характеристики её подтверждением либо принятием. Критерий, оценка и пояснение оценщика также остаются предметом разбора».

Раздел исходного документа

Документы и выдержки

  • [X1] Grok 4.7 Model Card · 2026-09-21

    Короткий фрагмент · английский оригинал

    MASK-Rectified

    Перевод для этого разбора: MASK-Rectified

    Название испытания в разделе 11.1, печатная страница 25. Документ о Grok 4.7.

    Дата обращения: 4 октября 2026.

  • [X2] xAI Frontier Artificial Intelligence Framework · 2026-06-30

    Короткий фрагмент · английский оригинал

    Risk Identification

    Перевод для этого разбора: Выявление рисков

    Заголовок раздела 2.1. Документ действует с 30 июня 2026 года.

    Дата обращения: 4 октября 2026.

История переписки

Получено служебное сообщение · Ожидается ответ по существу

Статус обновлён: .

  1. Подготовлена редакция 1.0

    Подготовлены полный текст письма, два предлагаемых дополнения и материалы для сравнительного испытания. Выбран адрес для отправки.

    Планируемый канал: Электронная почта

    Куда будет направлено

    Кому
    safety@x.ai

    Подготовленная редакция

  2. Отправлено · 04.10.2026

    Автор сообщил об отправке письма на safety@x.ai 4 октября 2026 года. Английская редакция 1.0 сохранена по ссылке ниже.

    Канал отправки: Электронная почта

    Кому
    safety@x.ai

    Отправленная редакция

  3. Служебное сообщение xAI Safety Team

    Сообщение с подписью xAI Safety Team описывает порядок обработки обращений. Ответа на предложения открытого письма в нём нет.

    Прочитать сообщениеПеревод RU · текст EN

    Источник: скриншот, предоставленный автором 4 октября 2026 года. Текст сообщения перенесён со скриншота; экранные переносы строк объединены в абзацы.

    Перевод beforeword · RU

    Спасибо за обращение в команду безопасности xAI.
    
    Сообщения о проблемах безопасности моделей ИИ:
    -- Если вы отправили на этот адрес электронной почты сообщение о проблеме, связанной с возможной эксплуатацией уязвимостей передовых моделей ИИ (например, с обходом ограничений — jailbreaking — или внедрением инструкций — prompt injection), оно обрабатывается для оценки нашей командой. Если потребуется дополнительная информация, мы свяжемся с вами.
    
    По вопросам, не связанным с безопасностью моделей ИИ:
    -- Сообщайте об уязвимостях информационной безопасности через программу xAI Bug Bounty на HackerOne: https://hackerone.com/x?type=team.
    -- Сообщайте о проблемах, связанных с безопасностью детей, по адресу childsafety@x.ai.
    
    Спасибо!
    Команда безопасности xAI
    

    Текст со скриншота · EN

    Thank you for contacting xAI's Safety Team.
    
    Submittals of AI model safety issues:
    -- If you have submitted to this email address an issue that is directed to the potential exploitation of frontier AI models (ex., jailbreaking or prompt-injection issues), then it is being processed for our evaluation.  We will reach out to you if further information is needed.
    
    For issues other than AI model safety issues:
    -- Please submit security vulnerabilities to xAI's Bug Bounty Program on HackerOne: https://hackerone.com/x?type=team.
    -- Please submit child safety issues to childsafety@x.ai.
    
    Thanks!
    xAI Safety Team
    

    Комментарий beforeword

    Указание на обработку для оценки сформулировано условно: оно относится к обращениям о потенциальной эксплуатации моделей ИИ. Из этого сообщения не следует, что предложения открытого письма уже изучены или приняты к рассмотрению.

История показывает опубликованные записи по состоянию на указанную дату. Уведомление о получении не считается ответом по существу.