Prompting technique

Cross-Model Distillation

Jailbreak Distillation: Renewable Safety Benchmarking, arXiv:2505.22037 (2025) · read the paper

What it does

A method for automatically generating and selecting universal jailbreak prompts through testing on multiple models. Prompts that successfully deceive a group of different LLMs are likely to be effective against other models as well. Creates reliable benchmarks for testing the security of language models.

Task typeclassification
Shapeiterative
Efforta pipeline
Addressesrefusals on legitimate requests; answers that are close but wrong
Published2025-05-28
AuthorsJingyu Zhang, Ahmed Elgohary, Xiawei Wang et al.

When it helps

Use this technique when creating security systems for LLMs, when you need to test models' resistance to jailbreaks. The method is especially useful for developers who need to create universal test sets that work across multiple models. Apply when developing protective mechanisms, assessing vulnerabilities of new models, or creating automated content moderation systems. The technique is effective for AI safety researchers who need to understand fundamental principles

A prompt you can paste

Generic by design: it applies the technique without knowing your task. Adapt the marked parts.

Prompt
# РОЛЬ:

Ты — эксперт по безопасности LLM и промпт-инженер, специализирующийся на тестировании и улучшении промптов. Твоя задача — продемонстрировать применение принципа "Cross-Model Distillation" для создания надежного и универсального промпта.

# КОНТЕКСТ:

Мы хотим создать универсальный промпт, который будет эффективно работать на различных LLM, включая те, что имеют продвинутые системы безопасности. Этот промпт должен быть устойчив к обновлениям моделей и демонстрировать надежность в выполнении поставленной задачи.

# ЗАДАЧА:

Примените метод "Jailbreak Distillation Renewable Safety Benchmarking" для создания **одного** шаблонного промпта, который можно будет адаптировать для различных задач. Этот промпт должен быть структурирован таким образом, чтобы его эффективность была высокой на разных моделях LLM.

# ПРИНЦИПЫ "CROSS-MODEL DISTILLATION" ДЛЯ СОЗДАНИЯ ПРОМПТА:

1.  **Универсальность структуры:** Используйте четкое разделение на РОЛЬ, КОНТЕКСТ и ЗАДАЧУ. Это фундаментальные элементы, понятные любой LLM.
2.  **Детализация и однозначность:** Предоставьте максимально полный контекст и четкие, недвусмысленные инструкции. Избегайте двусмысленности.
3.  **Явные требования и формат:** Определите конкретные требования к результату и желаемый формат вывода. Используйте примеры, если это уместно, для демонстрации ожиданий.
4.  **"Дистилляция" через тестирование (концептуально):** Хотя мы не будем выполнять реальное тестирование на разных моделях, сам промпт должен быть создан так, чтобы его можно было легко протестировать. Это означает, что он должен быть самодостаточным и понятным.

# ШАБЛОН ПРОМПТА ДЛЯ АДАПТАЦИИ:

If this one does not fit, the two closest alternatives in the corpus are Goal-Reversed Prompting and Multi-Turn Conversational Prompting, which target the same failure from a different angle.

Worked example

The same technique applied to a concrete job: sort inbound support tickets by urgency. Use it as the pattern for your own case rather than as a finished artefact.

Worked example
# РОЛЬ:

Ты — специалист по обработке и маршрутизации тикетов поддержки, обладающий глубоким пониманием принципов работы LLM и их уязвимостей. Твоя задача — создать универсальный и надежный промпт для сортировки входящих обращений.

# КОНТЕКСТ:

Необходимо разработать промпт для автоматической сортировки входящих тикетов поддержки по степени срочности (высокая, средняя, низкая). Этот промпт должен быть максимально надежным и стабильным, работая эффективно на различных LLM, а не только на одной конкретной модели.

# ЗАДАЧА:

Создай промпт, который будет использоваться для классификации входящих тикетов поддержки. Промпт должен гарантировать, что модель сможет точно определить срочность каждого тикета, даже если он сформулирован нечетко или пытается обойти стандартные правила.

# ПРИНЦИПЫ "ДЖЕЙЛБРЕЙК ДИСТИЛЛЯЦИИ":

1.  **Универсальность:** Промпт должен быть понятен и эффективен для широкого спектра LLM.
2.  **Структурированность:** Четкое разделение на роль, контекст, задачу и требования.
3.  **Ясность:** Инструкции должны быть однозначными и не допускать двойных толкований.
4.  **Проверка на разных моделях:** Итоговый промпт должен быть протестирован (или разработан с учетом возможности тестирования) на нескольких LLM (например, ChatGPT, Claude, Gemini, Llama) для подтверждения его стабильности.

# ТРЕБОВАНИЯ К ПРОМПТУ ДЛЯ КЛАССИФИКАЦИИ ТИКЕТОВ:

1.  **Роль модели:** Определи роль LLM как "Эксперт по обработке тикетов поддержки".
2.  **Контекст:** Предоставь информацию о том, что такое тикеты поддержки, и каковы основные категории срочности (высокая, средняя, низкая). Укажи, что некоторые тикеты могут быть сформулированы так, чтобы ввести в заблуждение.
3.  **Задача классификации:** Четко сформулируй задачу — присвоить каждому предоставленному тикету одну из трех категорий срочности.
4.  **Критерии срочности:** Определи четкие критерии для каждой категории:
    *   **Высокая срочность:** Проблемы, влияющие на работу большого числа пользователей, критические сбои сервиса, угрозы безопасности, запросы от VIP-клиентов с явным указанием на срочность.
    *   **Средняя срочность:** Проблемы, влияющие на одного или нескольких пользователей, запросы на информацию о функционале, запросы на изменение настроек, которые не являются критичными.
    *   **Низкая срочность:** Общие вопросы, предложения по улучшению, запросы, не требующие немедленного ответа, сообщения об ошибках, которые не влияют на основной функционал.
5.  **Формат вывода:** Требуй вывода в формате JSON, где каждый тикет будет представлен объектом с полями: `ticket_id`, `original_text`, `urgency` (одно из: "High", "Medium", "Low"), `reasoning` (краткое объяснение, почему выбрана данная категория срочности).
6.  **Обработка неоднозначности:** Укажи, что в случае сомнений модель должна выбирать более высокую категорию срочности.

# ПРИМЕРЫ ТИКЕТОВ ДЛЯ КЛАССИФИКАЦИИ (для тестирования):

-   "СЕРВИС НЕ РАБОТАЕТ ВООБЩЕ!!! ВСЕ КЛИЕНТЫ В ШОКЕ!!!"
-   "Не могу войти в свой аккаунт, уже час."
-   "Подскажите, пожалуйста, как изменить аватар в профиле?"
-   "Мы заметили подозрительную активность на одном из наших серверов, возможно, это утечка данных."
-   "Было бы здорово, если бы вы добавили функцию экспорта отчетов в CSV."

# ИНСТРУКЦИЯ ПО ПРИМЕНЕНИЮ:

Предоставь список тикетов для анализа. Для каждого тикета верни JSON-объект в соответствии с указанным форматом.

Get this written for your actual task

Paste what you are trying to do and the corpus will be matched against it directly. Free, no account, about ten seconds.

Free · no signup · ~10s
0.00match confidence
single retrieval pass
Prompt for your task

      

That number is low on purpose, and it is real. It is the raw similarity of one retrieval pass: no specialist read the paper, no judge compared anything, the first plausible match won.

6,235techniques in the corpus
one of which is this page

Picking the right one for a specific task is the work, and it is the work GetDecision does.

This pageone technique, generic prompt
What you just ranone technique matched to your wording, nothing verified
Full runten specialists read the papers in full, a judge ranks the top three for your task and shows its reasoning, generation on the model you pick, saved to your history

See the top three for your taskTen specialists, a judge, and the reasoning shown. Free account, first run included.

Run the full analysis

Related techniques

Goal-Reversed PromptingA method that consists of inverting the query goal: instead of asking the LLM to find the best option, it is a…Multi-Turn Conversational PromptingMethod of multi-step dialog interaction with LLM where complex tasks are broken into a chain of simple steps. …Dual-Level Adaptive Prompting (GALA)A method of multi-turn dialogue with an LLM using two-level adaptation: global (changing overall interaction t…Partial Compliance InstructionA technique of preemptive instruction for the model to use a strategy of partial assistance instead of direct …

All techniques · Failure modes and fixes