Скилл для ИИ-агентов, который тестирует софт глазами пользователя
DeepSeek нашел дыру в безопасности, Claude не согласен
На GitHub выложен открытый скилл AI-PlayTest для ИИ-агентов, который проверяет функции программы глазами обычного пользователя — локально, на staging или в живой среде. Агент проходит путь от подготовки и выбора роли до списка багов и предложений по улучшению. Скилл рассчитан на тех, кто пишет код вместе с ИИ и хочет знать, сможет ли реальный человек пройти регистрацию, понять интерфейс и сохранить данные. Подходит для сайтов, приложений, игр, API и внутренних инструментов. Отдельно прописаны правила безопасности: перед живым тестом нужен бэкап, а пароли и токены в отчёты не попадают.
Репозиторий MGD_AI-PlayTest_SKILL на GitHub содержит общий скилл — набор инструкций для ИИ-агентов, который помогает проверять функции программы с точки зрения реального пользователя. Идея простая: автотесты говорят «тесты пройдены», но не отвечают на вопрос, разберётся ли в интерфейсе живой человек. Этот скилл ведёт агента по шагам: от подготовки до отчёта о найденных проблемах, и работает локально, на staging или в живой среде. Скилл сознательно универсален: он подходит для сайтов, приложений, админ-панелей, редакторов, игр, SaaS-инструментов, API, магазинов и внутренних инструментов. В описании он сформулирован для таких сред, как Claude Code и ChatGPT Codex, и других агентных окружений для разработки или QA, которые умеют читать markdown-скиллы. Установка — обычный клон репозитория в папку скиллов агента: для Claude Code создаётся каталог ~/.claude/skills, куда репозиторий клонируется как playtest, для Codex аналогично используется ~/.codex/skills. После этого в проекте можно писать /playtest или /playtest-live либо просто формулировать задачу словами: «сделай локальный play-тест» или «протестируй это вживую с точки зрения пользователя». Авторы оговаривают, что это конвенция промптов, а не гарантированные слэш-команды. В репозитории есть готовые шаблоны команд для .claude и .codex. Сначала агент уточняет вводные: что тестировать, в какой среде, из какой роли — новый пользователь, админ, игрок, покупатель, редактор, поддержка, гость. Он спрашивает, нужно ли имитировать несколько ролей или sub-агентов, есть ли тестовые доступы и коды, какие функции попали в чек-лист, какие риски у живого теста, как откатить тестовые данные и какие дополнительные инструменты разрешено использовать — браузерные, Playwright, деплой-скиллы, MCP-серверы. Затем создаётся локальная папка PLAYTEST, где каждый прогон получает подкаталог с датой и номером. Внутри — постановка задачи, протокол действий, оценка результатов, список багов с шагами воспроизведения, следующие задачи и предложения по улучшению: UX, UI, безопасность, приватность, производительность. Отдельная папка отведена под артефакты вроде скриншотов и логов, секреты туда писать нельзя. Папка PLAYTEST автоматически попадает в .gitignore, чтобы заметки и внутренние находки оставались локально. Для живых тестов правил больше. Перед записями в продакшн нужен бэкап или другой проверенный откат, тестовые данные должны быть явно временными, а план отката — готов заранее. Пароли, токены, письма, платёжные и персональные данные в файлы отчётов не попадают. В конце агент проверяет, что тестовые данные удалены; если безопасно откатить нельзя, он работает только на чтение или спрашивает разрешение. Если sub-агентов нет, главный агент отыгрывает роли по очереди и помечает это в отчёте. В набор входят SKILL.md, README, лицензия, .gitignore, шаблоны команд и скрипт init_playtest.py, который надёжно создаёт структуру папок; у него есть параметры mode (local или live), root и base. Для начинающего разработчика это недорогой способ добавить в свой пайплайн проверку «глазами пользователя» — дополнительный слой, который ловит непонятные интерфейсы и сломанные сценарии.