Многие специалисты смотрят на нейросети с надеждой, но часто получают разочаровывающие, слишком общие ответы. Особенно это знакомо аналитикам, чья работа требует точности, глубины и конкретики. Проблема не в технологии, а в подходе. Без правильной инструкции даже самый мощный инструмент бесполезен. Эта статья – практическое руководство, которое поможет превратить ИИ из генератора банальностей в реального помощника. Здесь собраны рабочие промпты для аналитика данных, которые решают конкретные задачи.
Вместо абстрактной теории вы найдете готовые шаблоны, которые можно сразу применять в работе. Материал построен так, чтобы вы не просто копировали текст, а понимали, почему именно такая формулировка дает нужный результат. Мы разберем все: от очистки данных до создания сложных моделей и визуализаций.
Что ждет вас в этой статье:
- Готовые запросы для рутинных и сложных аналитических задач.
- Объяснение механики работы каждого промпта.
- Разбор типичных ошибок, которые мешают получать качественный ответ от ИИ.
- Практические советы по интеграции нейросетей в ваш рабочий процесс.
Типичные ошибки при составлении запросов для ИИ в аналитике
Прежде чем переходить к готовым решениям, важно понять, что обычно идет не так. Многие наступают на одни и те же грабли, а потом удивляются, почему нейросеть “глупая” или “не понимает”. Избежав этих ошибок, вы повысите эффективность своих запросов в несколько раз.
- Просить “проанализировать данные”, не уточняя цель. Это главная и самая частая ошибка. Нейросеть не может читать мысли и не знает, что именно вы ищете: аномалии, тренды, точки роста или причины падения метрик. В итоге она выдает набор общих наблюдений, бесполезных для принятия решений.
- Не предоставлять контекст и структуру данных. Запрос “напиши SQL для поиска активных пользователей” без описания таблиц `users` и `activity`, их полей и связей – это прямой путь к нерабочему коду. ИИ должен знать, с чем он работает, иначе он будет просто фантазировать.
- Забывать про формат ответа. Вы потратили время на составление идеального запроса, а в ответ получили сплошной текст вместо таблицы, кода или списка. Всегда указывайте, в каком виде вам нужен результат: “в виде Python-кода”, “в формате Markdown-таблицы”, “в виде JSON”.
- Использовать слишком сложные и перегруженные запросы. Попытка решить десять задач одним промптом почти всегда проваливается. Разбивайте сложные задачи на последовательные шаги. Сначала – очистка данных, потом – разведочный анализ, затем – построение модели.
- Полностью доверять сгенерированному коду без проверки. Нейросеть – это помощник, а не непогрешимый оракул. Она может допускать ошибки в синтаксисе, логике или использовать устаревшие библиотеки. Любой сгенерированный код, особенно для важных расчетов, нужно тщательно проверять и тестировать.
- Отправлять в чат конфиденциальную или чувствительную информацию. Никогда не вставляйте в промпт реальные персональные данные клиентов, финансовые отчеты или коммерческую тайну. Для работы с ИИ используйте обезличенные или синтетические данные, сохраняя структуру оригинала.
Сравнение слабых и сильных промптов для задач аналитика
Разница между хорошим и плохим результатом часто кроется в деталях формулировки. Давайте на конкретных примерах посмотрим, как небольшое уточнение запроса кардинально меняет качество ответа. Это поможет вам натренировать “чутье” на эффективные инструкции для нейросети юристу и аналитику.
| Задача | Слабый (неэффективный) запрос | Сильный (конкретный) запрос | Почему сильный запрос работает лучше |
| Написать SQL-запрос | Напиши SQL, чтобы найти самых прибыльных клиентов. | Напиши SQL-запрос для PostgreSQL. Нужно найти топ-10 клиентов по сумме покупок за последний квартал (с 1 апреля по 30 июня 2023 года). У меня есть две таблицы: `customers` (с полями `customer_id`, `name`) и `orders` (с полями `order_id`, `customer_id`, `order_date`, `total_amount`). Результат выведи в виде таблицы с колонками `customer_name` и `total_spent`. | Сильный запрос указывает СУБД (PostgreSQL), конкретный период, точное количество (топ-10), структуру таблиц и полей, а также требуемый формат вывода. ИИ не нужно ничего додумывать. |
| Сгенерировать Python-код для визуализации | Сделай график продаж. | Ты – аналитик данных. Напиши код на Python с использованием библиотек Pandas и Matplotlib. Нужно построить линейный график, показывающий динамику ежедневных продаж за последний месяц. DataFrame `df` содержит столбцы `date` (тип datetime) и `sales` (тип float). Подпиши оси, добавь заголовок “Динамика продаж за Май 2023” и сетку на график. | Сильный запрос определяет роль, технологии (Pandas, Matplotlib), тип графика (линейный), структуру входных данных (DataFrame) и конкретные требования к оформлению (заголовки, оси, сетка). |
| Провести разведочный анализ (EDA) | Проанализируй этот датасет. | Проведи разведочный анализ (EDA) для датасета, описывающего отток клиентов. Вот переменные: [список переменных с их типами]. Твоя задача: 1. Рассчитать основные статистические показатели для числовых признаков. 2. Найти и визуализировать пропуски в данных. 3. Построить матрицу корреляции. 4. Проанализировать распределение целевой переменной (отток). Ответ структурируй по пунктам. | Сильный запрос задает четкий план действий. Он не просто просит “анализировать”, а дает конкретные шаги (статистики, пропуски, корреляция, распределение), что делает результат структурированным и полезным. |
| Очистка данных | Почисти данные. | У меня есть DataFrame Pandas с данными о пользователях. В столбце `phone_number` содержатся телефонные номера в разных форматах (‘+7(999)123-45-67’, ‘8-999-1234567’, ‘9991234567’). Напиши Python-функцию, которая принимает на вход такой столбец и приводит все номера к единому формату ‘79991234567’. Функция должна обрабатывать пропущенные значения (NaN), оставляя их без изменений. | Сильный запрос описывает конкретную проблему (разные форматы номеров), предоставляет примеры “грязных” данных, указывает желаемый конечный формат и оговаривает пограничный случай (обработка пропусков). |
29 промптов для аналитика данных для генерации кода и идей
Ниже представлены готовые шаблоны запросов, сгруппированные по типовым задачам аналитика. Каждый промпт построен так, чтобы минимизировать “шум” и получить от нейросети максимально точный и применимый на практике результат. Просто скопируйте текст, подставьте свои данные в переменные и используйте в работе.
1. Очистка и предобработка данных
Проблема:
В наборе данных есть пропущенные значения, и нужно выбрать оптимальную стратегию их заполнения, чтобы не исказить результаты анализа.
Решение:
Промпт помогает ИИ проанализировать характер пропусков и предложить несколько обоснованных методов их заполнения (например, средним, медианой, модой или с помощью модели).
Текст промпта:
*****
Ты – опытный специалист по данным (Data Scientist). У меня есть DataFrame в Pandas, загруженный из файла [укажите источник, например, “CSV-файл о продажах”]. В нем есть пропущенные значения в следующих столбцах: [перечислите столбцы с пропусками, например, “Age”, “Income”].
Твоя задача – предложить и обосновать стратегии для заполнения этих пропусков.
Проанализируй каждый столбец и для каждого предложи 2-3 варианта обработки пропусков. Обоснуй, в каком случае какой метод лучше применять (например, “заполнение средним подходит для нормально распределенных данных без выбросов, а медиана – если есть выбросы”).
Формат ответа:
1. Название столбца.
2. Предлагаемые методы (например, “Заполнение медианой”, “Создание категории ‘Неизвестно'”).
3. Обоснование и условия применения каждого метода.
4. Пример кода на Python для реализации наиболее предпочтительного метода.
*****
Почему это работает:
Промпт не просто просит “заполнить пропуски”, а заставляет ИИ выступить в роли эксперта, проанализировать данные и предложить несколько взвешенных решений с объяснением их плюсов и минусов. Это учит и помогает выбрать лучший подход.
2. Генерация Python-функции для приведения данных к нужным типам
Проблема:
После загрузки данных многие столбцы имеют неправильный тип (например, даты как строки, числа как объекты), что мешает проводить вычисления и анализ.
Решение:
Запрос генерирует Python-код, который автоматически определяет и преобразует типы данных в DataFrame, основываясь на их содержимом.
Текст промпта:
*****
Ты – Python-разработчик, специализирующийся на обработке данных. Напиши универсальную функцию на Python, которая принимает на вход DataFrame библиотеки Pandas.
Функция должна делать следующее:
1. Итерироваться по каждому столбцу DataFrame.
2. Пытаться преобразовать каждый столбец к числовому типу (numeric), если это возможно.
3. Если преобразование в число не удалось, пытаться преобразовать столбец к типу datetime.
4. Если и это не удалось, оставить столбец как есть (object).
5. Функция должна возвращать обновленный DataFrame.
Добавь в код комментарии, объясняющие логику работы. Обработай возможные ошибки при преобразовании типов.
*****
Почему это работает:
Промпт дает четкий алгоритм действий для функции, указывает на необходимость обработки ошибок и комментирования кода. Это позволяет получить готовый, переиспользуемый и понятный инструмент для автоматической предобработки данных.
3. Поиск и удаление дубликатов
Проблема:
В данных присутствуют дублирующиеся записи, которые могут исказить статистику и результаты моделирования.
Решение:
Промпт генерирует код для идентификации и удаления дубликатов, позволяя выбрать, какие столбцы считать ключевыми для определения уникальности записи.
Текст промпта:
*****
Ты – аналитик данных. У меня есть DataFrame `df` с данными о [опишите данные, например, “заказах в интернет-магазине”]. Я подозреваю, что в нем есть дубликаты.
Напиши код на Python (Pandas), который выполнит следующие шаги:
1. Выведет количество полных дубликатов во всем DataFrame.
2. Найдет и покажет дубликаты на основе комбинации столбцов [перечислите ключевые столбцы, например, “`user_id` и `order_date`”].
3. Создаст новый DataFrame `df_cleaned`, в котором будут удалены эти дубликаты. При удалении нужно оставить первую встретившуюся запись.
4. Выведет итоговое количество строк до и после очистки.
*****
Почему это работает:
Запрос детализирует задачу: не просто “удали дубли”, а покажи их, определи критерии дублирования (по конкретным столбцам) и сравни результат до и после. Такой подход обеспечивает контроль над процессом очистки.
4. Разведочный анализ данных (EDA)
Проблема:
Получен новый набор данных, и нужно быстро составить о нем первое впечатление: понять структуру, распределения, найти аномалии и основные зависимости.
Решение:
Этот комплексный промпт запускает полноценный разведочный анализ, результаты которого структурируются в удобный для чтения отчет.
Текст промпта:
*****
Ты – старший аналитик данных. Тебе предоставлен датасет [опишите датасет, например, “о клиентах телеком-компании”]. Переменные в датасете: [перечислите названия столбцов и, если возможно, их краткое описание]. Целевая переменная – [укажите целевую переменную, например, “`Churn` (отток)”].
Проведи комплексный разведочный анализ данных (EDA) и представь результаты в виде структурированного отчета. Отчет должен включать:
1. Общая информация: размер датасета, типы данных, количество пропусков по каждому столбцу.
2. Анализ числовых признаков: основные описательные статистики (среднее, медиана, стандартное отклонение, мин/макс) для каждого числового столбца. Построй гистограммы их распределений.
3. Анализ категориальных признаков: подсчет уникальных значений для каждого категориального столбца. Построй столбчатые диаграммы их частот.
4. Анализ целевой переменной: рассчитай и визуализируй дисбаланс классов.
5. Корреляционный анализ: построй тепловую карту корреляций Пирсона для всех числовых признаков.
6. Предварительные выводы: на основе анализа, сформулируй 3-5 ключевых наблюдений или гипотез для дальнейшего исследования.
Сгенерируй код на Python с использованием библиотек Pandas, Matplotlib и Seaborn для выполнения всех этих шагов.
*****
Почему это работает:
Это не просто запрос, а четкое техническое задание. Структура отчета задана заранее, что заставляет ИИ работать последовательно и выдавать полный, логичный и легко интерпретируемый результат. Это экономит часы ручной работы.
5. Генерация SQL-запроса с несколькими JOIN
Проблема:
Нужно собрать данные из нескольких связанных таблиц в базе данных, но написание сложных SQL-запросов с несколькими `JOIN` отнимает время и чревато ошибками.
Решение:
Промпт позволяет описать структуру таблиц и желаемый результат на естественном языке, а ИИ преобразует это в готовый и оптимизированный SQL-запрос.
Текст промпта:
*****
Ты – эксперт по SQL. Мне нужно написать запрос для СУБД [укажите СУБД, например, “PostgreSQL”]. У меня есть следующие таблицы:
1. `employees` (поля: `id`, `name`, `department_id`)
2. `departments` (поля: `id`, `department_name`)
3. `salaries` (поля: `employee_id`, `amount`, `date`)
Задача: написать один SQL-запрос, который выведет имена сотрудников, названия их отделов и их последнюю зарплату (самую свежую по полю `date`). Выводить нужно только сотрудников из отдела [укажите название отдела, например, “‘Разработка'”].
Результат должен содержать три столбца: `name`, `department_name`, `amount`.
*****
Почему это работает:
Промпт четко описывает “вход” (структура таблиц и их поля) и “выход” (требуемые столбцы и фильтры). Это полностью снимает с ИИ необходимость угадывать названия полей и логику связей, что ведет к точному результату.
6. Создание оконной функции в SQL
Проблема:
Нужно рассчитать сложные метрики, такие как скользящее среднее или ранг внутри группы, что требует использования оконных функций в SQL, синтаксис которых бывает неочевиден.
Решение:
Запрос генерирует SQL-код с оконной функцией, основываясь на описании задачи.
Текст промпта:
*****Ты – SQL-разработчик. Напиши SQL-запрос с использованием оконной функции. У меня есть таблица `payments` с полями `user_id`, `payment_date`, `amount`.
Задача: для каждого пользователя рассчитать его ранг по сумме платежа внутри каждого дня. То есть, самый крупный платеж пользователя за день должен иметь ранг 1, второй по величине – 2, и так далее.
Итоговый запрос должен выводить `user_id`, `payment_date`, `amount` и новый столбец `daily_rank`. Используй диалект SQL для [укажите СУБД, например, “ClickHouse”].
*****
Почему это работает:
Промпт четко формулирует логику партиционирования (`PARTITION BY`) и упорядочивания (`ORDER BY`) для оконной функции, описывая бизнес-логику (“ранг по сумме платежа внутри каждого дня”). Это позволяет ИИ точно выбрать и настроить нужную функцию (`RANK()` или `DENSE_RANK()`).
7. Генерация кода для A/B-теста
Проблема:
Проведен A/B-тест, и нужно статистически грамотно проанализировать его результаты, чтобы принять верное бизнес-решение.
Решение:
Промпт генерирует полный пайплайн анализа A/B-теста на Python, включая расчет метрик, проверку статистической значимости и интерпретацию результатов.
Текст промпта:
*****
Ты – аналитик данных, специализирующийся на A/B-тестировании. У меня есть данные A/B-теста в CSV-файле с колонками: `user_id`, `group` (‘A’ – контроль, ‘B’ – тест), `converted` (1 – конверсия, 0 – нет).
Напиши скрипт на Python, который:
1. Загружает данные из файла.
2. Рассчитывает коэффициент конверсии для каждой группы (A и B).
3. Проводит t-тест (или Z-тест для пропорций) для определения, является ли разница в конверсиях статистически значимой.
4. Выводит p-value и четкий вывод: “Разница статистически значима” или “Статистически значимой разницы не обнаружено” при уровне значимости alpha = 0.05.
5. Объясни, что означает полученное p-value простым языком для менеджера.
*****
Почему это работает:
Промпт задает полный цикл анализа: от загрузки данных до интерпретации результатов для нетехнических специалистов. Указание конкретного статистического теста и уровня значимости делает результат точным и воспроизводимым.
8. Построение простой модели машинного обучения
Проблема:
Нужно быстро проверить гипотезу или построить базовую предиктивную модель, не тратя много времени на написание всего кода с нуля.
Решение:
Запрос генерирует код для обучения и оценки простой модели (например, логистической регрессии) “под ключ”.
Текст промпта:
*****
Ты – специалист по машинному обучению. Напиши скрипт на Python с использованием Scikit-learn для построения модели классификации.
Данные: DataFrame `df`, где `X` – это признаки [перечислите названия столбцов-признаков], а `y` – это целевая переменная [название целевого столбца] (бинарная: 0 или 1).
Скрипт должен выполнить следующие шаги:
1. Разделить данные на обучающую и тестовую выборки в соотношении 80/20.
2. Обучить модель логистической регрессии (`LogisticRegression`) на обучающей выборке.
3. Сделать предсказания на тестовой выборке.
4. Рассчитать и вывести основные метрики качества: accuracy, precision, recall, F1-score и ROC-AUC.
5. Построить и отобразить матрицу ошибок (confusion matrix).
*****
Почему это работает:
Запрос предоставляет четкий и стандартный пайплайн для задачи классификации. Указание конкретной модели и списка метрик гарантирует, что ИИ сгенерирует полный и корректный код для оценки качества модели.
9. Генерация синтетических данных
Проблема:
Нужно протестировать скрипт, алгоритм или визуализацию, но реальных данных под рукой нет, или их нельзя использовать из-за соображений конфиденциальности.
Решение:
Промпт создает датафрейм с нужной структурой и характером распределений, который можно использовать для любых тестов.
Текст промпта:
*****
Ты – генератор данных. Создай DataFrame в Pandas на 1000 строк, имитирующий данные о пользователях. DataFrame должен содержать следующие столбцы:
– `user_id`: уникальный идентификатор от 1 до 1000.
– `age`: возраст, распределенный нормально со средним 30 и стандартным отклонением 8. Значения должны быть целыми числами от 18 до 65.
– `city`: город, случайный выбор из списка [“Москва”, “Санкт-Петербург”, “Новосибирск”, “Екатеринбург”, “Казань”].
– `registration_date`: дата регистрации, случайная дата в пределах 2022 года.
– `balance`: баланс на счете, случайное число с плавающей точкой от 0 до 50000.
Сгенерируй код на Python, который создает такой DataFrame.
*****
Почему это работает:
Промпт очень конкретен: он указывает не только названия и типы столбцов, но и характер распределения данных (нормальное для возраста), конкретные значения (список городов) и диапазоны. Это позволяет получить реалистичные данные для тестирования.
10. Написание парсера для веб-страницы
Проблема:
Нужно извлечь структурированную информацию с веб-страницы (например, цены, названия товаров), но писать парсер вручную долго и утомительно.
Решение:
Запрос генерирует Python-код для парсинга, который можно легко адаптировать под нужную страницу, указав CSS-селекторы или теги.
Текст промпта:
*****
Ты – Python-разработчик, эксперт по веб-скрапингу. Напиши скрипт на Python с использованием библиотек `requests` и `BeautifulSoup4` для парсинга данных с веб-страницы.
Целевая страница: [URL страницы, например, “https://ru.wikipedia.org/wiki/Список_городов-миллионеров_России”].
Задача: извлечь таблицу с городами-миллионерами. Для каждой строки таблицы нужно получить название города и его население.
Результат сохрани в виде списка словарей, где каждый словарь представляет один город. Например: `[{‘city’: ‘Москва’, ‘population’: ‘13104177’}, …]`.
Укажи в коде, какие теги и классы ты используешь для поиска таблицы и извлечения данных.
*****
Почему это работает:
Промпт указывает конкретный URL, библиотеки и, самое главное, желаемую структуру выходных данных. Просьба указать селекторы заставляет ИИ явно прописать логику поиска, что упрощает отладку и адаптацию кода.
11. Рефакторинг и оптимизация кода
Проблема:
Есть работающий, но медленный или трудночитаемый Python-скрипт, который нужно улучшить.
Решение:
ИИ выступает в роли опытного ревьюера: анализирует код, находит узкие места и предлагает более эффективные и “пайтоник” решения.
Текст промпта:
*****
Ты – старший Python-разработчик с опытом оптимизации кода. Проведи рефакторинг следующего фрагмента кода.
Цель: сделать код более читаемым (согласно PEP8), эффективным и “пайтоник”.
Вот исходный код:
“`python
[вставьте сюда ваш медленный или некрасивый код, например, цикл for, который можно заменить на векторизованную операцию Pandas]“`
Твоя задача:
1. Переписать код, применив лучшие практики.
2. Добавить комментарии, объясняющие, какие именно улучшения были сделаны и почему (например, “заменил цикл for на векторизованную операцию, так как это работает в разы быстрее на больших объемах данных”).
3. Указать на потенциальные “бутылочные горлышки” в исходном коде.
*****
Почему это работает:
Промпт не просто просит “улучшить”, а ставит конкретные цели (читаемость, эффективность) и требует объяснить внесенные изменения. Это не только дает оптимизированный код, но и обучает лучшим практикам программирования.
12. Создание интерактивной визуализации
Проблема:
Статичные графики не всегда позволяют глубоко исследовать данные. Нужен интерактивный дашборд, где можно фильтровать и детализировать информацию.
Решение:
Запрос генерирует код для создания интерактивного графика или простого дашборда с помощью библиотек Plotly или Altair.
Текст промпта:
*****
Ты – специалист по визуализации данных. Напиши код на Python для создания интерактивной визуализации с помощью библиотеки `Plotly Express`.
У меня есть DataFrame `df` с данными о [опишите данные, например, “продажах автомобилей”] со столбцами: `brand`, `model`, `price`, `year`, `mileage`.
Задача: создать диаграмму рассеяния (scatter plot), где:
– Ось X – `mileage` (пробег).
– Ось Y – `price` (цена).
– Цвет точек соответствует `brand` (марка).
– Размер точек соответствует `year` (год выпуска).
– При наведении на точку отображается информация о `model`.
Добавь к графику заголовок “Зависимость цены от пробега и года выпуска”.
*****
Почему это работает:
Промпт детально описывает “мэппинг” переменных из данных на визуальные элементы графика (оси, цвет, размер, всплывающие подсказки). Это позволяет ИИ однозначно понять задачу и использовать все возможности библиотеки для создания насыщенной интерактивной визуализации.
13. Поиск аномалий в данных
Проблема:
В данных могут присутствовать выбросы или аномальные значения, которые необходимо обнаружить перед построением модели или анализом.
Решение:
Промпт предлагает использовать один из классических методов для поиска аномалий (например, метод межквартильного размаха) и генерирует код для его применения.
Текст промпта:
*****
Ты – аналитик данных, специализирующийся на поиске аномалий. У меня есть DataFrame `df` и числовой столбец `[укажите название столбца, например, ‘transaction_amount’]`, в котором я хочу найти выбросы.
Напиши код на Python (Pandas), который реализует метод поиска аномалий на основе межквартильного размаха (IQR).
Алгоритм:
1. Рассчитай первый (Q1) и третий (Q3) квартили для указанного столбца.
2. Рассчитай межквартильный размах (IQR = Q3 – Q1).
3. Определи границы для выбросов: `lower_bound = Q1 – 1.5 * IQR` и `upper_bound = Q3 + 1.5 * IQR`.
4. Найди и выведи все строки DataFrame, где значение в указанном столбце выходит за эти границы.
5. Объясни простыми словами, почему именно коэффициент 1.5 используется в этом методе.
*****
Почему это работает:
Промпт дает ИИ точный и общепринятый алгоритм действий. Просьба объяснить теоретическую основу метода (коэффициент 1.5) заставляет нейросеть предоставить не только код, но и полезный контекст, улучшающий понимание процесса.
14. Проведение когортного анализа
Проблема:
Нужно проанализировать удержание пользователей (retention), сгруппировав их по времени регистрации или первой покупки (когорты).
Решение:
Этот сложный промпт генерирует полный код для расчета и визуализации когортного анализа Retention Rate.
Текст промпта:
*****
Ты – Senior Data Analyst. Мне нужно провести когортный анализ удержания пользователей. У меня есть DataFrame `df` с данными о действиях пользователей. В нем есть столбцы:
– `user_id`: ID пользователя
– `event_date`: дата действия пользователя (тип datetime)
Напиши скрипт на Python (с использованием Pandas), который:
1. Для каждого `user_id` найдет дату его первой активности (дату формирования когорты).
2. Создаст столбец с названием когорты в формате ‘ГГГГ-ММ’.
3. Рассчитает “возраст” каждой активности в месяцах относительно даты формирования когорты.
4. Построит сводную таблицу (pivot table), где строками будут когорты, столбцами – “возраст” когорты в месяцах, а значениями – количество уникальных пользователей.
5. Преобразует эту таблицу в retention-матрицу (в процентах от исходного размера когорты).
6. Визуализирует полученную retention-матрицу с помощью тепловой карты (heatmap) из библиотеки Seaborn с аннотациями.
Код должен быть подробно прокомментирован на каждом шаге.
*****
Почему это работает:
Когортный анализ – многоступенчатый процесс. Промпт разбивает его на четкие, логически связанные шаги. Это один из тех случаев, где подробное ТЗ для ИИ экономит несколько часов сложной и кропотливой работы.
15. Объяснение результатов модели для бизнеса
Проблема:
Построена сложная модель машинного обучения, но ее результаты нужно объяснить менеджерам или заказчикам на простом и понятном языке, без технических терминов.
Решение:
Промпт заставляет ИИ выступить в роли “переводчика” с технического языка на язык бизнеса, интерпретируя метрики и результаты модели.
Текст промпта:
*****
Ты – связующее звено между командой аналитиков и бизнес-руководством. Мы построили модель, которая предсказывает отток клиентов. Вот ее ключевые показатели:
– Precision: 0.85
– Recall: 0.70
– ROC-AUC: 0.92
– Самые важные признаки, влияющие на предсказание: “длительность контракта”, “сумма ежемесячного платежа”, “наличие техподдержки”.
Твоя задача – написать короткое (2-3 абзаца) объяснение этих результатов для генерального директора, который не разбирается в машинном обучении.
В своем объяснении:
– Не используй слова “precision”, “recall”, “ROC-AUC”.
– Объясни на простых примерах, что означают эти цифры. Например: “Из 100 клиентов, которых модель пометила как ‘уходящих’, 85 действительно собирались уйти”.
– Сделай акцент на практической пользе: как мы можем использовать эту модель для удержания клиентов, опираясь на важные признаки.
– Тон должен быть деловым, но понятным.
*****
Почему это работает:
Промпт четко определяет целевую аудиторию (директор) и ее ограничения (не знает терминов). Он заставляет ИИ сфокусироваться не на технических деталях, а на бизнес-ценности и практическом применении результатов анализа.
16. Генерация регулярного выражения
Проблема:
Нужно извлечь или проверить данные, соответствующие сложному шаблону (например, email-адреса, артикулы товаров), а составлять “регулярки” вручную – то еще удовольствие.
Решение:
ИИ генерирует готовое регулярное выражение на основе описания и примеров.
Текст промпта:
*****
Ты – эксперт по регулярным выражениям. Создай регулярное выражение, которое находит артикулы товаров в тексте.
Формат артикула:
– Начинается с 2-3 заглавных латинских букв (префикс).
– Затем идет дефис (-).
– Затем 5-7 цифр.
– Может заканчиваться необязательным суффиксом в виде дефиса и одной заглавной буквы (например, -A).
Примеры для совпадения: “AB-12345”, “CDE-9876543”, “XYZ-55555-B”.
Примеры, которые не должны совпадать: “ab-12345”, “CDE-123”, “XYZ-55555-bb”.
Предоставь только само регулярное выражение и краткое объяснение его частей.
*****
Почему это работает:
Ключ к успеху – предоставление как положительных, так и отрицательных примеров. Это помогает ИИ точнее понять границы шаблона и избежать распространенных ошибок в составлении регулярных выражений.
17. Прогнозирование временных рядов
Проблема:
Есть данные за прошлые периоды (например, продажи, трафик), и нужно построить прогноз на будущее.
Решение:
Промпт генерирует код для построения простой прогностической модели временного ряда, например, SARIMA.
Текст промпта:
*****
Ты – специалист по анализу временных рядов. У меня есть временной ряд в виде Pandas Series с ежедневными данными о [опишите данные, например, “количестве посетителей сайта”] за последние 3 года. Индекс – datetime.
Напиши код на Python, который:
1. Использует библиотеку `statsmodels` для построения модели SARIMA.
2. Автоматически подбирает оптимальные параметры (p, d, q) и сезонные параметры (P, D, Q, s) с помощью функции `auto_arima` из библиотеки `pmdarima`. Считай, что сезонность годовая (s=12 для месячных данных, но здесь надо адаптировать для дневных, возможно, s=7 для недельной).
3. Обучает модель на всех доступных данных.
4. Строит прогноз на следующие [укажите период, например, “30 дней”].
5. Визуализирует исторические данные, прогноз и доверительный интервал на одном графике.
*****
Почему это работает:
Промпт не заставляет пользователя подбирать сложные параметры модели вручную, а предлагает использовать для этого автоматизированные инструменты (`auto_arima`). Это значительно упрощает задачу и делает ее доступной даже для неспециалистов во временных рядах.
18. Сегментация клиентов (RFM-анализ)
Проблема:
Нужно сегментировать клиентскую базу по их покупательской активности, чтобы выстроить персонализированные коммуникации.
Решение:
Запрос генерирует полный код для проведения RFM-анализа – классического метода сегментации клиентов.
Текст промпта:
*****
Ты – маркетолог-аналитик. Проведи RFM-анализ клиентской базы. У меня есть DataFrame `df` с историей транзакций, содержащий столбцы:
– `CustomerID`
– `InvoiceDate` (дата покупки, тип datetime)
– `Quantity` (количество товара)
– `UnitPrice` (цена за единицу)
Напиши скрипт на Python, который:
1. Рассчитывает общую сумму каждой покупки.
2. Устанавливает текущую дату для анализа (например, на один день позже последней даты в данных).
3. Для каждого `CustomerID` рассчитывает три метрики:
– Recency (R): количество дней с последней покупки.
– Frequency (F): общее количество покупок.
– Monetary (M): общая сумма денег, потраченная клиентом.
4. Сегментирует клиентов, присваивая им ранги от 1 до 4 по каждой из метрик (R, F, M) на основе квантилей.
5. Объединяет ранги в RFM-сегменты (например, “444” – лучшие клиенты, “111” – ушедшие).
6. Выводит итоговый DataFrame с `CustomerID` и его RFM-метриками/сегментами.
*****
Почему это работает:
RFM-анализ, как и когортный, является стандартным, но многошаговым процессом. Промпт четко раскладывает его на атомарные операции, что гарантирует получение корректного и полного решения “под ключ”.
19. Подготовка текста для NLP-задач
Проблема:
Есть массив текстовых данных (отзывы, комментарии), который нужно подготовить для дальнейшего анализа или моделирования (например, для сентимент-анализа).
Решение:
Промпт генерирует функцию для предобработки текста: токенизация, лемматизация, удаление стоп-слов.
Текст промпта:
*****Ты – NLP-инженер. Напиши функцию на Python для предобработки русского текста. Функция должна принимать на вход одну строку текста.
Этапы обработки:
1. Привести текст к нижнему регистру.
2. Удалить все символы, кроме букв русского алфавита и пробелов.
3. Токенизировать текст (разбить на слова).
4. Удалить стоп-слова. Используй готовый список стоп-слов из библиотеки `nltk` для русского языка.
5. Провести лемматизацию каждого слова (привести к начальной форме). Используй библиотеку `pymorphy2`.
6. Вернуть строку, состоящую из обработанных токенов, соединенных пробелом.
Код должен быть снабжен комментариями, объясняющими каждый шаг.
*****
Почему это работает:
Промпт четко указывает последовательность шагов и конкретные библиотеки (`nltk`, `pymorphy2`), которые являются стандартом для обработки русского языка. Это позволяет получить рабочий и эффективный код для типичной NLP-задачи.
20. Генерация запроса к API
Проблема:
Нужно получить данные из внешнего источника через REST API, но не хочется разбираться в документации и писать код для запроса с нуля.
Решение:
Промпт генерирует Python-код для отправки GET-запроса к API и обработки ответа.
Текст промпта:
*****
Ты – Python-разработчик. Напиши скрипт, который получает данные из публичного API.
API-эндпоинт: [укажите URL эндпоинта, например, “https://api.exchangerate-api.com/v4/latest/USD”].
Задача: отправить GET-запрос к этому API, получить ответ в формате JSON, извлечь из него [укажите, что нужно извлечь, например, “курс рубля (RUB)”] и вывести на экран.
Используй библиотеку `requests`. Добавь в код обработку возможных ошибок (например, если сервер недоступен или вернул ошибку).
*****
Почему это работает:
Промпт предоставляет всю необходимую информацию: URL, метод запроса (подразумевается GET), что нужно извлечь из ответа. Просьба обработать ошибки делает сгенерированный код более надежным и готовым к использованию.
21. Сравнение двух датафреймов
Проблема:
Есть два набора данных, которые должны быть идентичными, и нужно быстро найти расхождения между ними.
Решение:
ИИ генерирует код на Pandas, который находит различия в данных, структуре или значениях двух DataFrame.
Текст промпта:
*****
Ты – QA-инженер в аналитике. У меня есть два Pandas DataFrame: `df1` и `df2`. Они должны быть идентичны, но я подозреваю, что есть расхождения.
Напиши код на Python, который:
1. Сравнивает названия и порядок столбцов. Если они не совпадают, выводит различия.
2. Сравнивает типы данных в столбцах. Если есть расхождения, выводит их.
3. Если структура совпадает, находит и выводит строки, которые присутствуют в `df1`, но отсутствуют в `df2` (и наоборот), используя определенный столбец как ключ (`[укажите ключевой столбец, например, ‘id’]`).
4. Для строк с одинаковым ключом находит и выводит ячейки, значения в которых не совпадают.
*****
Почему это работает:
Промпт разбивает сложную задачу “сравнить все” на конкретные проверки: столбцы, типы, отсутствующие строки и различия в значениях. Это обеспечивает систематический и полный аудит данных.
22. Расчет LTV (Lifetime Value)
Проблема:
Нужно рассчитать пожизненную ценность клиента (LTV) – одну из ключевых метрик для оценки прибыльности бизнеса.
Решение:
Запрос генерирует код для расчета LTV на основе исторических данных о покупках и когортах.
Текст промпта:
*****
Ты – продуктовый аналитик. Мне нужно рассчитать LTV клиентов. У меня есть данные о транзакциях в DataFrame `df` со столбцами `CustomerID`, `InvoiceDate`, `TotalPrice`.
Напиши Python-скрипт для расчета LTV по когортам.
Алгоритм:
1. Определи когорту для каждого клиента по месяцу его первой покупки.
2. Рассчитай кумулятивный (накопительный) доход для каждой когорты по месяцам с момента первой покупки.
3. Раздели кумулятивный доход на количество клиентов в когорте, чтобы получить средний LTV по “возрасту” когорты.
4. Представь результат в виде сводной таблицы, где строки – когорты, а столбцы – месяцы жизни когорты (0, 1, 2…).
5. Визуализируй LTV нескольких ключевых когорт на одном линейном графике.
*****
Почему это работает:
Промпт задает классический и методологически верный способ расчета LTV через когортный анализ. Четкое описание шагов и формата результата позволяет ИИ сгенерировать сложный, но корректный аналитический код.
23. Объяснение сложного SQL-запроса
Проблема:
Вы получили от коллеги сложный SQL-запрос с вложенными подзапросами, оконными функциями и CTE, и не можете быстро понять, что он делает.
Решение:
ИИ анализирует SQL-код и объясняет его логику по шагам на простом языке.
Текст промпта:
*****
Ты – SQL-ментор. Объясни, что делает следующий SQL-запрос. Разбери его логику по шагам, как если бы ты объяснял это младшему аналитику.
Вот запрос:
“`sql
[вставьте сюда ваш сложный SQL-запрос]“`
Формат объяснения:
1. Общая цель запроса: Что он пытается вычислить в итоге?
2. Разбор по частям (CTE, подзапросы): Объясни, что вычисляется в каждой временной таблице (блок `WITH`) или подзапросе.
3. Логика соединений (JOINs): Как таблицы связаны друг с другом.
4. Финальная агрегация и фильтрация: Что происходит на последнем шаге.
Используй простой язык, избегай излишнего жаргона.
*****
Почему это работает:
Промпт заставляет ИИ структурировать объяснение, двигаясь от общего к частному. Это превращает монолитный и пугающий код в последовательность понятных логических шагов, что идеально для обучения и ревью кода.
24. Создание дашборда в Streamlit
Проблема:
Нужно быстро создать простой интерактивный веб-дашборд для демонстрации результатов анализа, не погружаясь в веб-разработку.
Решение:
Промпт генерирует готовый к запуску скрипт для создания дашборда на популярной библиотеке Streamlit.
Текст промпта:
*****
Ты – Python-разработчик, создающий аналитические приложения. Напиши скрипт `app.py` для простого дашборда с использованием библиотеки `streamlit`.
У меня есть датасет `data.csv` со столбцами `country`, `year`, `population`.
Дашборд должен содержать:
1. Заголовок: “Динамика населения по странам”.
2. Селект-бокс (выпадающий список) на боковой панели для выбора страны (`st.sidebar.selectbox`). Список стран должен формироваться из данных.
3. При выборе страны дашборд должен отфильтровать данные и построить линейный график (`st.line_chart`), показывающий динамику населения (`population`) по годам (`year`) для выбранной страны.
4. Под графиком должна отображаться таблица (`st.dataframe`) с отфильтрованными данными.
Сгенерируй полный и готовый к запуску код.
*****
Почему это работает:
Промпт детально прописывает структуру и логику дашборда: какие элементы управления использовать (`selectbox`), где их разместить (на боковой панели) и как они должны влиять на отображаемые данные (фильтрация и обновление графика/таблицы).
25. Генерация документации для функции
Проблема:
Написана полезная, но сложная функция, и нужно создать для нее понятную документацию (docstring), чтобы другие могли ею пользоваться.
Решение:
ИИ анализирует код функции и генерирует для нее документацию в стандартном формате.
Текст промпта:
*****
Ты – технический писатель. Напиши подробную docstring для следующей Python-функции в формате Google Style.
Вот функция:
“`python
[вставьте сюда код вашей функции без документации]“`
Docstring должна включать:
– Краткое описание функции в одно предложение.
– Раздел `Args:` с описанием каждого аргумента, его типа и назначения.
– Раздел `Returns:` с описанием возвращаемого значения и его типа.
– (Опционально) Раздел `Raises:` с описанием возможных исключений.
– (Опционально) Пример использования в блоке `Example:`.
*****
Почему это работает:
Промпт указывает на конкретный и широко используемый стандарт оформления документации (Google Style). Это гарантирует, что результат будет не просто описанием, а структурированной и профессионально оформленной документацией, понятной другим разработчикам и инструментам.
26. Поиск оптимальных параметров для модели (Grid Search)
Проблема:
Эффективность модели машинного обучения сильно зависит от ее гиперпараметров. Подбирать их вручную долго и неэффективно.
Решение:
Промпт генерирует код для автоматического подбора гиперпараметров с помощью `GridSearchCV`.
Текст промпта:
*****
Ты – ML-инженер. У меня есть модель `XGBoost Classifier` для задачи бинарной классификации. Мне нужно найти оптимальные гиперпараметры для нее.
Напиши код на Python (с использованием Scikit-learn), который:
1. Определяет сетку параметров для перебора (`param_grid`). Включи в нее: `n_estimators` [50, 100, 200], `max_depth` [3, 5, 7], `learning_rate` [0.01, 0.1].
2. Создает экземпляр `GridSearchCV` с моделью `XGBClassifier`, сеткой параметров, 5-кратной кросс-валидацией (cv=5) и метрикой для оптимизации `roc_auc`.
3. Запускает поиск по сетке на обучающих данных `X_train`, `y_train`.
4. Выводит наилучшие найденные параметры (`best_params_`) и наилучший результат на кросс-валидации (`best_score_`).
*****
Почему это работает:
Промпт четко определяет модель, список параметров для перебора, метод валидации (кросс-валидация) и целевую метрику. Это все необходимые компоненты для корректного использования `GridSearchCV`, что позволяет получить готовый код для одной из самых важных задач в ML.
27. Разработка системы метрик для продукта
Проблема:
Запускается новый продукт или функция, и нужно определить ключевые метрики, по которым будет оцениваться его успешность.
Решение:
ИИ выступает в роли опытного продакт-менеджера и предлагает иерархическую систему метрик.
Текст промпта:
*****
Ты – опытный продуктовый аналитик. Мы запускаем новую функцию в нашем приложении [опишите приложение, например, “сервис доставки еды”]. Функция называется [название функции, например, “‘Групповой заказ'”].
Цель функции: [опишите цель, например, “позволить нескольким пользователям совместно формировать один заказ”].
Твоя задача – разработать систему метрик для оценки успешности этой функции. Представь метрики в виде “дерева” или иерархии:
1. North Star Metric (Метрика Полярной звезды): одна главная метрика, отражающая ценность для пользователя.
2. Продуктовые метрики (уровень 2): 3-4 метрики, которые влияют на North Star (например, adoption rate, engagement rate, retention rate).
3. Диагностические метрики (уровень 3): более низкоуровневые метрики, которые помогают понять, ПОЧЕМУ меняются метрики уровня 2 (например, среднее количество участников в групповом заказе, время формирования заказа, процент ошибок).
Для каждой метрики дай краткое определение и объясни, почему она важна.
*****
Почему это работает:
Промпт предлагает известную и эффективную структуру (иерархия метрик), что заставляет ИИ мыслить системно. Он не просто перечисляет метрики, а выстраивает их в логическую связь, от главной цели до конкретных операционных показателей.
28. Перевод бизнес-вопроса в аналитическую задачу
Проблема:
Менеджер приходит с очень общим вопросом вроде “Почему у нас упали продажи?”, и аналитику нужно декомпозировать его в конкретный план действий.
Решение:
Промпт помогает превратить абстрактный бизнес-вопрос в набор конкретных гипотез и шагов для их проверки.
Текст промпта:
*****
Ты – руководитель отдела аналитики. К тебе пришел менеджер по маркетингу с вопросом: “Почему в прошлом месяце конверсия в покупку на нашем сайте упала на 15%?”
Твоя задача – декомпозировать этот вопрос в четкий план аналитического исследования.
Представь свой ответ в виде списка:
1. Формулировка гипотез: предложи 5-7 возможных причин падения конверсии (например, “проблема в новом обновлении сайта”, “изменился состав трафика”, “сезонный спад”, “активность конкурентов”, “технические ошибки на странице оплаты”).
2. Необходимые данные: для каждой гипотезы укажи, какие данные нужны для ее проверки (например, “данные веб-аналитики по источникам трафика”, “логи ошибок”, “данные о версиях приложения”).
3. План анализа: опиши по шагам, что ты будешь делать для проверки каждой гипотезы (например, “сравню конверсию по сегментам трафика до и после падения”, “проанализирую воронку оформления заказа на предмет аномалий”).
*****
Почему это работает:
Этот промпт имитирует мыслительный процесс опытного аналитика. Он учит не бросаться сразу в данные, а сначала структурировать проблему, выдвинуть гипотезы и только потом определять методы их проверки. Это один из важнейших навыков в аналитике.
29. Написание ТЗ для разработчиков на основе анализа
Проблема:
Аналитик нашел проблему или точку роста (например, узкое место в воронке) и теперь ему нужно сформулировать задачу для команды разработки.
Решение:
ИИ помогает составить четкое техническое задание (ТЗ), которое будет понятно разработчикам.
Текст промпта:
*****
Ты – продуктовый аналитик, который ставит задачи в разработку. По результатам анализа я выяснил, что [опишите инсайт, например, “30% пользователей уходят со страницы оплаты, когда видят стоимость доставки”].
Мне нужно, чтобы ты на основе этого инсайта составил техническое задание для разработчиков на доработку.
ТЗ должно быть в формате User Story и включать:
1. Заголовок: краткое название задачи.
2. User Story: “Как [роль пользователя], я хочу [что сделать], чтобы [получить какую выгоду]”.
3. Обоснование: кратко изложи суть проблемы со ссылкой на данные (“По данным аналитики, мы теряем X% пользователей…”).
4. Критерии приемки (Acceptance Criteria): список конкретных условий, при выполнении которых задача считается сделанной (например, “Стоимость доставки теперь отображается в корзине ДО перехода к оплате”, “Пользователь видит итоговую сумму с учетом доставки”).
5. Требования к аналитике: какие события нужно отправлять в систему аналитики после внедрения фичи для оценки ее эффекта.
Тон должен быть четким, формальным и недвусмысленным.
*****
Почему это работает:
Промпт использует стандартный для IT-индустрии формат постановки задач (User Story, Acceptance Criteria). Это гарантирует, что разработчики правильно поймут суть проблемы, ее бизнес-контекст и критерии успешного выполнения, что снижает риски недопонимания.
Продвинутые команды для уточнения запросов в анализе данных
Помимо самих промптов, существуют специальные команды-модификаторы, которые помогают управлять поведением нейросети и получать более точные или креативные результаты. Вот некоторые из них, особенно полезные в работе аналитика.
| Команда/Модификатор | Описание | Пример использования в промпте для аналитика |
| Мысли по шагам | Заставляет ИИ сначала составить план действий, а затем следовать ему. Это повышает логичность и точность сложных ответов. | “…Напиши Python-скрипт для когортного анализа. Прежде чем писать код, изложи свою логику и план действий по шагам.“ |
| Задай мне уточняющие вопросы | Если в вашем запросе не хватает информации, эта команда заставит ИИ не додумывать, а спросить вас о недостающих деталях. | “…Мне нужен SQL-запрос для поиска оттока. Если тебе не хватает информации о структуре таблиц или определении оттока, задай мне уточняющие вопросы.“ |
| Сгенерируй N вариантов | Полезно, когда нет единственно верного решения. ИИ предложит несколько альтернативных подходов к задаче. | “…Предложи стратегию для заполнения пропусков в столбце ‘доход’. Сгенерируй 3 разных варианта с обоснованием для каждого.“ |
| Действуй как критик | Просит ИИ найти слабые места, ошибки или потенциальные риски в предоставленном коде, гипотезе или плане. | “Вот мой Python-код для A/B-теста. Действуй как строгий ревьюер и укажи на все потенциальные ошибки и недочеты в моей методологии и коде.“ |
| Объясни как для [аудитория] | Адаптирует сложность и стиль ответа под указанную аудиторию (например, “для пятиклассника”, “для маркетолога”, “для CTO”). | “…Объясни, что такое p-value. Объясни это так, как будто рассказываешь менеджеру по продажам, который ничего не знает о статистике.“ |
| Используй формат [формат] | Прямое указание на желаемый формат вывода: JSON, Markdown, CSV, YAML и т.д. Помогает получить структурированный и машиночитаемый результат. | “…Извлеки данные о товарах с этой страницы. Результат представь в виде списка объектов JSON, где каждый объект содержит поля ‘name’, ‘price’, ‘url’.“ |
Неочевидные советы по работе с ИИ для аналитика
Освоив базовые и продвинутые промпты для аналитика данных, можно пойти еще дальше. Есть несколько приемов, которые многие упускают, но которые могут серьезно повысить вашу продуктивность.
- Создавайте “персону” для всей сессии чата. Вместо того чтобы в каждом промпте писать “Ты – аналитик данных”, начните диалог с установочного промпта: “На протяжении всего нашего разговора ты будешь выступать в роли старшего специалиста по данным с 10-летним опытом в [ваша сфера, например, ‘электронной коммерции’]. Твои ответы должны быть точными, структурированными и подкреплены примерами кода”. Это настраивает модель на нужный лад для всей беседы.
- Используйте ИИ для генерации гипотез, а не только для их проверки. Когда вы не знаете, с чего начать анализ, попросите нейросеть помочь. Например: “В прошлом квартале LTV наших клиентов вырос на 15%. Сгенерируй 10 наиболее вероятных гипотез, которые могли бы это объяснить”. Это отличный способ расширить свой взгляд на проблему.
- Просите ИИ не только писать, но и документировать код. После того как нейросеть сгенерировала вам сложную функцию или SQL-запрос, следующим промптом попросите: “Теперь напиши подробную документацию (docstring) для этого кода” или “Объясни логику этого запроса по шагам”. Так вы получаете не только решение, но и понятное описание к нему.
- Применяйте “цепочку промптов” для сложных задач. Не пытайтесь решить все одним махом. Разбейте задачу на этапы и используйте вывод одного промпта как ввод для следующего. Например: 1) промпт на очистку данных; 2) промпт на разведочный анализ очищенных данных; 3) промпт на построение модели на основе результатов анализа.
- Используйте ИИ как спарринг-партнера для критики ваших идей. Прежде чем презентовать свои выводы команде, изложите их нейросети и попросите: “Действуй как скептически настроенный руководитель. Какие слабые места ты видишь в моей аргументации? Какие дополнительные вопросы ты бы задал?”. Это помогает подготовиться к реальным возражениям и укрепить свою позицию.
- Сохраняйте удачные промпты в личную библиотеку. Если вы нашли формулировку, которая идеально решает вашу типовую задачу, не надейтесь запомнить ее. Создайте документ или заметку, куда будете складывать свои лучшие шаблоны для нейросети в аналитике, сгруппировав их по темам. Через пару месяцев у вас будет мощный персональный инструмент.