ИИшники

Практика ИИ

Восстановление промпта по ответу: почему скрытая инструкция не должна хранить секреты

The Decoder рассказал об исследовании восстановления запросов по тексту ответов языковой модели. Работа касается коротких промптов и не доказывает взлом любых коммерческих помощников. Для бизнеса она даёт повод пересмотреть, какие сведения вообще допустимо помещать в инструкции.

Редакция ИИшниковРедакционный разбор архивной публикации

Коротко

  • Исследователи обучали обратную модель на синтетических данных.
  • Перенос на другой генератор восстанавливал смысл, не обязательно точную формулировку.
  • Длинные многоабзацные системные инструкции в описанном исследовании не проверяли.
AI-диспетчер для сервиса: как держать заявки, мастеров и качество под контролем
Сохранённая архивная иллюстрация; не фотография описанного продукта.

Что удалось исследователям

В публикации от 12 августа 2026 года The Decoder описывает работу IIT Bombay и Adobe Research. Метод Previous-Token Prediction обучает модель предсказывать предыдущие токены вместо следующих. Обучающие примеры получают синтетически от модели, чьи ответы затем анализируют.

Издание приводит пример точного восстановления короткого вопроса и несколько смысловых вариантов. Существенная деталь: разные формулировки могут приводить к похожим ответам. Поэтому совпадение общего намерения и побуквенное восстановление исходного текста следует считать разными результатами.

Обратная модель, обученная на ответах небольшого Qwen, также восстанавливала смысл запросов по ответам GPT-4o. Согласно пересказу исследования, формулировки в этом случае не совпадали буквально. Доступ к весам целевой модели для такого переноса не требовался.

Какие сведения не стоит скрывать в промпте

Представим помощника, который готовит ответы поставщикам. В его инструкции записана внутренняя закупочная граница: максимальная допустимая цена и условия, при которых компания согласится на исключение. Даже без точного восстановления инструкции серия ответов может раскрывать логику уступок.

Это редакционный пример, а не демонстрация метода из статьи. Он показывает, почему секретность текста инструкции сама по себе слабо обосновывает защиту решения. Сведения, которые помощник учитывает в формулировках, могут повлиять на то, что увидит внешний получатель.

Разделите правила общения и закрытые параметры сделки. Первые можно описать в инструкции. Вторые лучше получать через ограниченный интерфейс, который возвращает только разрешённый результат проверки. Например, подтверждение допустимости предложения без раскрытия полного диапазона внутренних цен.

Ключи доступа и пароли не нужны модели для рассуждения о письме. Их место в механизме выполнения разрешённой операции, где значение не включается в контекст и ответ. Такая архитектура уменьшает последствия раскрытия инструкции независимо от применимости конкретного исследования.

Как проверить собственный помощник

Начните с инвентаризации контекста: системный текст, примеры, найденные документы и результаты инструментов. Для каждого фрагмента определите, кому разрешено знать его содержание. Метка «внутренний» без перечня получателей не позволяет оценить допустимость внешнего ответа.

Затем подготовьте безопасные вымышленные условия сделки и серию обычных вопросов. Проверяйте, какие параметры можно вывести из полученных писем. Для первого испытания не нужны реальные коммерческие секреты или попытка воспроизвести исследовательский алгоритм на чужом сервисе.

Оценивать следует весь диалог. Один ответ может быть достаточно общим, а уточнения постепенно раскрывать границу решения. Сохраните последовательность запросов и вывод независимого проверяющего: что он узнал и какие ответы позволили это предположить.

Где проходит граница выводов

Если тест не обнаружил утечки, это не доказывает невозможность восстановления. Он проверил конкретные вопросы, модель и набор данных. После изменения инструкции или добавления нового поиска прежний результат нельзя автоматически переносить на обновлённого помощника.

При обнаружении раскрытия исправляйте источник доступа, а не только запрещённую формулировку. Переписанная фраза может скрыть симптом в одном диалоге, сохранив ту же зависимость ответа от закрытых сведений. Повторное испытание должно включать другие способы задать тот же деловой вопрос.

Работа о восстановлении промптов не означает, что любой ответ раскрывает всё содержимое контекста. Её полезный практический вывод уже: текстовая инструкция не является самостоятельным хранилищем секретов. Проектировать доступ нужно так, чтобы даже её раскрытие не открывало ключи и закрытые решения.

Источники и границы разбора

  1. The DecoderResearchers can now reverse-engineer LLM prompts from output text with near-perfect accuracy

    Прочитан сохранённый доступный текст публикации. Заявления участников переданы с атрибуцией; независимого испытания редакция не проводила.

Факты ограничены прочитанным текстом The Decoder. Практические рекомендации являются редакционным анализом, а не результатами внедрения. Историческая дата публикации сохранена.

Обсудить проверку в вашей компании

Разделить скрытые инструкции, закрытые параметры сделки и разрешённые внешние ответы.

Обсудить задачу