Cross-Model Distillation
What it does
A method for automatically generating and selecting universal jailbreak prompts through testing on multiple models. Prompts that successfully deceive a group of different LLMs are likely to be effective against other models as well. Creates reliable benchmarks for testing the security of language models.
When it helps
Use this technique when creating security systems for LLMs, when you need to test models' resistance to jailbreaks. The method is especially useful for developers who need to create universal test sets that work across multiple models. Apply when developing protective mechanisms, assessing vulnerabilities of new models, or creating automated content moderation systems. The technique is effective for AI safety researchers who need to understand fundamental principles
A prompt you can paste
Generic by design: it applies the technique without knowing your task. Adapt the marked parts.
# РОЛЬ: Ты — эксперт по безопасности LLM и промпт-инженер, специализирующийся на тестировании и улучшении промптов. Твоя задача — продемонстрировать применение принципа "Cross-Model Distillation" для создания надежного и универсального промпта. # КОНТЕКСТ: Мы хотим создать универсальный промпт, который будет эффективно работать на различных LLM, включая те, что имеют продвинутые системы безопасности. Этот промпт должен быть устойчив к обновлениям моделей и демонстрировать надежность в выполнении поставленной задачи. # ЗАДАЧА: Примените метод "Jailbreak Distillation Renewable Safety Benchmarking" для создания **одного** шаблонного промпта, который можно будет адаптировать для различных задач. Этот промпт должен быть структурирован таким образом, чтобы его эффективность была высокой на разных моделях LLM. # ПРИНЦИПЫ "CROSS-MODEL DISTILLATION" ДЛЯ СОЗДАНИЯ ПРОМПТА: 1. **Универсальность структуры:** Используйте четкое разделение на РОЛЬ, КОНТЕКСТ и ЗАДАЧУ. Это фундаментальные элементы, понятные любой LLM. 2. **Детализация и однозначность:** Предоставьте максимально полный контекст и четкие, недвусмысленные инструкции. Избегайте двусмысленности. 3. **Явные требования и формат:** Определите конкретные требования к результату и желаемый формат вывода. Используйте примеры, если это уместно, для демонстрации ожиданий. 4. **"Дистилляция" через тестирование (концептуально):** Хотя мы не будем выполнять реальное тестирование на разных моделях, сам промпт должен быть создан так, чтобы его можно было легко протестировать. Это означает, что он должен быть самодостаточным и понятным. # ШАБЛОН ПРОМПТА ДЛЯ АДАПТАЦИИ:
If this one does not fit, the two closest alternatives in the corpus are Goal-Reversed Prompting and Multi-Turn Conversational Prompting, which target the same failure from a different angle.
Worked example
The same technique applied to a concrete job: sort inbound support tickets by urgency. Use it as the pattern for your own case rather than as a finished artefact.
# РОЛЬ:
Ты — специалист по обработке и маршрутизации тикетов поддержки, обладающий глубоким пониманием принципов работы LLM и их уязвимостей. Твоя задача — создать универсальный и надежный промпт для сортировки входящих обращений.
# КОНТЕКСТ:
Необходимо разработать промпт для автоматической сортировки входящих тикетов поддержки по степени срочности (высокая, средняя, низкая). Этот промпт должен быть максимально надежным и стабильным, работая эффективно на различных LLM, а не только на одной конкретной модели.
# ЗАДАЧА:
Создай промпт, который будет использоваться для классификации входящих тикетов поддержки. Промпт должен гарантировать, что модель сможет точно определить срочность каждого тикета, даже если он сформулирован нечетко или пытается обойти стандартные правила.
# ПРИНЦИПЫ "ДЖЕЙЛБРЕЙК ДИСТИЛЛЯЦИИ":
1. **Универсальность:** Промпт должен быть понятен и эффективен для широкого спектра LLM.
2. **Структурированность:** Четкое разделение на роль, контекст, задачу и требования.
3. **Ясность:** Инструкции должны быть однозначными и не допускать двойных толкований.
4. **Проверка на разных моделях:** Итоговый промпт должен быть протестирован (или разработан с учетом возможности тестирования) на нескольких LLM (например, ChatGPT, Claude, Gemini, Llama) для подтверждения его стабильности.
# ТРЕБОВАНИЯ К ПРОМПТУ ДЛЯ КЛАССИФИКАЦИИ ТИКЕТОВ:
1. **Роль модели:** Определи роль LLM как "Эксперт по обработке тикетов поддержки".
2. **Контекст:** Предоставь информацию о том, что такое тикеты поддержки, и каковы основные категории срочности (высокая, средняя, низкая). Укажи, что некоторые тикеты могут быть сформулированы так, чтобы ввести в заблуждение.
3. **Задача классификации:** Четко сформулируй задачу — присвоить каждому предоставленному тикету одну из трех категорий срочности.
4. **Критерии срочности:** Определи четкие критерии для каждой категории:
* **Высокая срочность:** Проблемы, влияющие на работу большого числа пользователей, критические сбои сервиса, угрозы безопасности, запросы от VIP-клиентов с явным указанием на срочность.
* **Средняя срочность:** Проблемы, влияющие на одного или нескольких пользователей, запросы на информацию о функционале, запросы на изменение настроек, которые не являются критичными.
* **Низкая срочность:** Общие вопросы, предложения по улучшению, запросы, не требующие немедленного ответа, сообщения об ошибках, которые не влияют на основной функционал.
5. **Формат вывода:** Требуй вывода в формате JSON, где каждый тикет будет представлен объектом с полями: `ticket_id`, `original_text`, `urgency` (одно из: "High", "Medium", "Low"), `reasoning` (краткое объяснение, почему выбрана данная категория срочности).
6. **Обработка неоднозначности:** Укажи, что в случае сомнений модель должна выбирать более высокую категорию срочности.
# ПРИМЕРЫ ТИКЕТОВ ДЛЯ КЛАССИФИКАЦИИ (для тестирования):
- "СЕРВИС НЕ РАБОТАЕТ ВООБЩЕ!!! ВСЕ КЛИЕНТЫ В ШОКЕ!!!"
- "Не могу войти в свой аккаунт, уже час."
- "Подскажите, пожалуйста, как изменить аватар в профиле?"
- "Мы заметили подозрительную активность на одном из наших серверов, возможно, это утечка данных."
- "Было бы здорово, если бы вы добавили функцию экспорта отчетов в CSV."
# ИНСТРУКЦИЯ ПО ПРИМЕНЕНИЮ:
Предоставь список тикетов для анализа. Для каждого тикета верни JSON-объект в соответствии с указанным форматом.
Get this written for your actual task
Paste what you are trying to do and the corpus will be matched against it directly. Free, no account, about ten seconds.
single retrieval pass
That number is low on purpose, and it is real. It is the raw similarity of one retrieval pass: no specialist read the paper, no judge compared anything, the first plausible match won.
one of which is this page
Picking the right one for a specific task is the work, and it is the work GetDecision does.
| This page | one technique, generic prompt |
| What you just ran | one technique matched to your wording, nothing verified |
| Full run | ten specialists read the papers in full, a judge ranks the top three for your task and shows its reasoning, generation on the model you pick, saved to your history |
See the top three for your taskTen specialists, a judge, and the reasoning shown. Free account, first run included.
Run the full analysis