ИИшники

Практика ИИ

Shieldstral: как проверить настраиваемый фильтр безопасности для ИИ

The Decoder описывает Shieldstral, модель Mistral для проверки содержания по правилам на обычном языке. Отделяем сообщения издания от нашего предложения: испытать фильтр на обращениях в поддержку до подключения автоматических блокировок.

Редакция ИИшников

Коротко

  • Правило задаётся вопросом с ответом «да» или «нет».
  • Тест разработчика не гарантирует качество на переписке компании.
  • Ошибочные запреты и пропущенные нарушения нужно считать отдельно.
AI-контроль рекламы для малого бизнеса: куда утекает бюджет и как это увидеть

Что описывает источник

По сообщению The Decoder, Shieldstral содержит три миллиарда параметров и проверяет текст, изображения и их сочетания. Оператор задаёт проверку вопросом вместо выбора только из заранее закреплённых категорий. Вероятности ответов используются для оценки содержания.

Издание пересказывает работу разработчиков, где модель сравнивают с более крупными классификаторами. Эти результаты относятся к выбранным наборам заданий. Мы не проверяли первичную работу и не переносим сравнительные показатели на клиентские переписки конкретной компании.

Для бизнеса интересна возможность менять правила без переобучения классификатора. Запрос специалиста по безопасности и просьба незнакомого пользователя могут содержать похожие слова, но требовать разной реакции. Запрет по одному слову здесь слишком груб.

Редакционное предложение: фильтр перед ответом поддержки

Начать стоит с одной очереди обращений, где сотрудники уже отмечают недопустимые ответы. Соберите обезличенные примеры и выпишите причину каждой отметки. Не включайте переписки, для обработки которых у команды нет законного основания или разрешения.

Затем превратите причины в проверяемые вопросы. Вместо расплывчатого «ответ опасный?» полезнее спросить, раскрывает ли ответ чужие персональные данные. Правило должно описывать содержание, а не эмоциональное впечатление проверяющего от тона сообщения.

Отдельно нужны допустимые примеры с похожей лексикой. Обсуждение возврата денег не равно финансовому мошенничеству, а сообщение об уязвимости не обязательно является инструкцией для нападения. Без таких пар тест поощряет чрезмерно строгую блокировку.

На первом этапе фильтр только ставит отметки. Оператор видит ответ системы и продолжает работать по обычному регламенту. Так можно сравнить оценки модели с разметкой сотрудников, не лишая клиентов помощи из-за ещё не настроенного порога.

Как разбирать расхождения

Для каждого спорного случая сохраняйте версию правила, входной текст и решение проверяющего. Одно изменение формулировки способно изменить поведение фильтра. Если история правил потеряна, команда не сможет объяснить, почему вчера похожий ответ прошёл проверку.

Считайте отдельно пропущенные нарушения и допустимые сообщения, которые фильтр остановил. Общая доля совпадений скрывает разницу между утечкой данных и лишним направлением к человеку. Для этих ошибок нужны разные ограничения и разные ответственные.

Измеряйте также задержку перед отправкой ответа. Быстрый основной ассистент не поможет, если очередь проверок растёт в часы нагрузки. Проверка на коротких одиночных запросах не показывает поведение при реальном потоке обращений.

  • Подготовьте допустимые и запрещённые примеры с близкими формулировками.
  • Проверьте русский язык, опечатки и сообщения со вложениями.
  • Назначьте сотрудника для пересмотра спорных блокировок.
  • Сохраните возможность вернуться к предыдущей версии правил.

Где заканчивается роль классификатора

Автоматическую остановку можно обсуждать после разбора ошибок в выбранной очереди. Сначала ограничьте её однозначными нарушениями, а неоднозначные случаи направляйте сотруднику. Порог должен отражать цену ошибки для конкретного сервиса, а не желание получить красивый процент в отчёте.

Итог испытания — версия правил с понятными ограничениями и журналом проверок. Если модель слишком часто задерживает нормальную помощь, оставьте её подсказчиком для контроля качества. Открытая модель сама по себе не делает автоматическую модерацию пригодной для любого бизнеса.

Источники и границы разбора

  1. The DecoderMistral's open model Shieldstral matches much larger safety models at a fraction of the size

    Прочитан доступный текст The Decoder. Результаты разработчиков переданы как сообщения вторичного источника; первичная работа независимо не проверена. Пилот поддержки предложен редакцией, а не описан как состоявшееся внедрение.

Прочитан доступный текст The Decoder. Результаты разработчиков переданы как сообщения вторичного источника; первичная работа независимо не проверена. Пилот поддержки предложен редакцией, а не описан как состоявшееся внедрение.

Обсудить проверку процесса

Разберём исходные материалы, критерии приёмки и действия, которые должны оставаться за сотрудником.

Обсудить задачу