ИИ-технологФлагман NP
ИИ-технолог

Промпты для аналитика данных. 29 готовых примеров для генерации

От NP_Article

ИИ-технолог

Обучение управлению ИИ с 0 до мастерского уровня

250+ уроков Начато наполнение Без инфоцыган и воды

Многие специалисты смотрят на нейросети с надеждой, но часто получают разочаровывающие, слишком общие ответы. Особенно это знакомо аналитикам, чья работа требует точности, глубины и конкретики. Проблема не в технологии, а в подходе. Без правильной инструкции даже самый мощный инструмент бесполезен. Эта статья – практическое руководство, которое поможет превратить ИИ из генератора банальностей в реального помощника. Здесь собраны рабочие промпты для аналитика данных, которые решают конкретные задачи.

Вместо абстрактной теории вы найдете готовые шаблоны, которые можно сразу применять в работе. Материал построен так, чтобы вы не просто копировали текст, а понимали, почему именно такая формулировка дает нужный результат. Мы разберем все: от очистки данных до создания сложных моделей и визуализаций.

Что ждет вас в этой статье:

  • Готовые запросы для рутинных и сложных аналитических задач.
  • Объяснение механики работы каждого промпта.
  • Разбор типичных ошибок, которые мешают получать качественный ответ от ИИ.
  • Практические советы по интеграции нейросетей в ваш рабочий процесс.

Типичные ошибки при составлении запросов для ИИ в аналитике

Прежде чем переходить к готовым решениям, важно понять, что обычно идет не так. Многие наступают на одни и те же грабли, а потом удивляются, почему нейросеть “глупая” или “не понимает”. Избежав этих ошибок, вы повысите эффективность своих запросов в несколько раз.

  1. Просить “проанализировать данные”, не уточняя цель. Это главная и самая частая ошибка. Нейросеть не может читать мысли и не знает, что именно вы ищете: аномалии, тренды, точки роста или причины падения метрик. В итоге она выдает набор общих наблюдений, бесполезных для принятия решений.
  2. Не предоставлять контекст и структуру данных. Запрос “напиши SQL для поиска активных пользователей” без описания таблиц `users` и `activity`, их полей и связей – это прямой путь к нерабочему коду. ИИ должен знать, с чем он работает, иначе он будет просто фантазировать.
  3. Забывать про формат ответа. Вы потратили время на составление идеального запроса, а в ответ получили сплошной текст вместо таблицы, кода или списка. Всегда указывайте, в каком виде вам нужен результат: “в виде Python-кода”, “в формате Markdown-таблицы”, “в виде JSON”.
  4. Использовать слишком сложные и перегруженные запросы. Попытка решить десять задач одним промптом почти всегда проваливается. Разбивайте сложные задачи на последовательные шаги. Сначала – очистка данных, потом – разведочный анализ, затем – построение модели.
  5. Полностью доверять сгенерированному коду без проверки. Нейросеть – это помощник, а не непогрешимый оракул. Она может допускать ошибки в синтаксисе, логике или использовать устаревшие библиотеки. Любой сгенерированный код, особенно для важных расчетов, нужно тщательно проверять и тестировать.
  6. Отправлять в чат конфиденциальную или чувствительную информацию. Никогда не вставляйте в промпт реальные персональные данные клиентов, финансовые отчеты или коммерческую тайну. Для работы с ИИ используйте обезличенные или синтетические данные, сохраняя структуру оригинала.

Сравнение слабых и сильных промптов для задач аналитика

Разница между хорошим и плохим результатом часто кроется в деталях формулировки. Давайте на конкретных примерах посмотрим, как небольшое уточнение запроса кардинально меняет качество ответа. Это поможет вам натренировать “чутье” на эффективные инструкции для нейросети юристу и аналитику.

Задача Слабый (неэффективный) запрос Сильный (конкретный) запрос Почему сильный запрос работает лучше
Написать SQL-запрос Напиши SQL, чтобы найти самых прибыльных клиентов. Напиши SQL-запрос для PostgreSQL. Нужно найти топ-10 клиентов по сумме покупок за последний квартал (с 1 апреля по 30 июня 2023 года). У меня есть две таблицы: `customers` (с полями `customer_id`, `name`) и `orders` (с полями `order_id`, `customer_id`, `order_date`, `total_amount`). Результат выведи в виде таблицы с колонками `customer_name` и `total_spent`. Сильный запрос указывает СУБД (PostgreSQL), конкретный период, точное количество (топ-10), структуру таблиц и полей, а также требуемый формат вывода. ИИ не нужно ничего додумывать.
Сгенерировать Python-код для визуализации Сделай график продаж. Ты – аналитик данных. Напиши код на Python с использованием библиотек Pandas и Matplotlib. Нужно построить линейный график, показывающий динамику ежедневных продаж за последний месяц. DataFrame `df` содержит столбцы `date` (тип datetime) и `sales` (тип float). Подпиши оси, добавь заголовок “Динамика продаж за Май 2023” и сетку на график. Сильный запрос определяет роль, технологии (Pandas, Matplotlib), тип графика (линейный), структуру входных данных (DataFrame) и конкретные требования к оформлению (заголовки, оси, сетка).
Провести разведочный анализ (EDA) Проанализируй этот датасет. Проведи разведочный анализ (EDA) для датасета, описывающего отток клиентов. Вот переменные: [список переменных с их типами]. Твоя задача: 1. Рассчитать основные статистические показатели для числовых признаков. 2. Найти и визуализировать пропуски в данных. 3. Построить матрицу корреляции. 4. Проанализировать распределение целевой переменной (отток). Ответ структурируй по пунктам. Сильный запрос задает четкий план действий. Он не просто просит “анализировать”, а дает конкретные шаги (статистики, пропуски, корреляция, распределение), что делает результат структурированным и полезным.
Очистка данных Почисти данные. У меня есть DataFrame Pandas с данными о пользователях. В столбце `phone_number` содержатся телефонные номера в разных форматах (‘+7(999)123-45-67’, ‘8-999-1234567’, ‘9991234567’). Напиши Python-функцию, которая принимает на вход такой столбец и приводит все номера к единому формату ‘79991234567’. Функция должна обрабатывать пропущенные значения (NaN), оставляя их без изменений. Сильный запрос описывает конкретную проблему (разные форматы номеров), предоставляет примеры “грязных” данных, указывает желаемый конечный формат и оговаривает пограничный случай (обработка пропусков).

29 промптов для аналитика данных для генерации кода и идей

Ниже представлены готовые шаблоны запросов, сгруппированные по типовым задачам аналитика. Каждый промпт построен так, чтобы минимизировать “шум” и получить от нейросети максимально точный и применимый на практике результат. Просто скопируйте текст, подставьте свои данные в переменные и используйте в работе.

1. Очистка и предобработка данных

Проблема:
В наборе данных есть пропущенные значения, и нужно выбрать оптимальную стратегию их заполнения, чтобы не исказить результаты анализа.

Решение:
Промпт помогает ИИ проанализировать характер пропусков и предложить несколько обоснованных методов их заполнения (например, средним, медианой, модой или с помощью модели).

Текст промпта:

*****

Ты – опытный специалист по данным (Data Scientist). У меня есть DataFrame в Pandas, загруженный из файла [укажите источник, например, “CSV-файл о продажах”]. В нем есть пропущенные значения в следующих столбцах: [перечислите столбцы с пропусками, например, “Age”, “Income”].

Твоя задача – предложить и обосновать стратегии для заполнения этих пропусков.

Проанализируй каждый столбец и для каждого предложи 2-3 варианта обработки пропусков. Обоснуй, в каком случае какой метод лучше применять (например, “заполнение средним подходит для нормально распределенных данных без выбросов, а медиана – если есть выбросы”).

Формат ответа:
1. Название столбца.
2. Предлагаемые методы (например, “Заполнение медианой”, “Создание категории ‘Неизвестно'”).
3. Обоснование и условия применения каждого метода.
4. Пример кода на Python для реализации наиболее предпочтительного метода.

*****

Почему это работает:
Промпт не просто просит “заполнить пропуски”, а заставляет ИИ выступить в роли эксперта, проанализировать данные и предложить несколько взвешенных решений с объяснением их плюсов и минусов. Это учит и помогает выбрать лучший подход.

2. Генерация Python-функции для приведения данных к нужным типам

Проблема:
После загрузки данных многие столбцы имеют неправильный тип (например, даты как строки, числа как объекты), что мешает проводить вычисления и анализ.

Решение:
Запрос генерирует Python-код, который автоматически определяет и преобразует типы данных в DataFrame, основываясь на их содержимом.

Текст промпта:

*****

Ты – Python-разработчик, специализирующийся на обработке данных. Напиши универсальную функцию на Python, которая принимает на вход DataFrame библиотеки Pandas.

Функция должна делать следующее:
1. Итерироваться по каждому столбцу DataFrame.
2. Пытаться преобразовать каждый столбец к числовому типу (numeric), если это возможно.
3. Если преобразование в число не удалось, пытаться преобразовать столбец к типу datetime.
4. Если и это не удалось, оставить столбец как есть (object).
5. Функция должна возвращать обновленный DataFrame.

Добавь в код комментарии, объясняющие логику работы. Обработай возможные ошибки при преобразовании типов.

*****

Почему это работает:
Промпт дает четкий алгоритм действий для функции, указывает на необходимость обработки ошибок и комментирования кода. Это позволяет получить готовый, переиспользуемый и понятный инструмент для автоматической предобработки данных.

3. Поиск и удаление дубликатов

Проблема:
В данных присутствуют дублирующиеся записи, которые могут исказить статистику и результаты моделирования.

Решение:
Промпт генерирует код для идентификации и удаления дубликатов, позволяя выбрать, какие столбцы считать ключевыми для определения уникальности записи.

Текст промпта:

*****

Ты – аналитик данных. У меня есть DataFrame `df` с данными о [опишите данные, например, “заказах в интернет-магазине”]. Я подозреваю, что в нем есть дубликаты.

Напиши код на Python (Pandas), который выполнит следующие шаги:
1. Выведет количество полных дубликатов во всем DataFrame.
2. Найдет и покажет дубликаты на основе комбинации столбцов [перечислите ключевые столбцы, например, “`user_id` и `order_date`”].
3. Создаст новый DataFrame `df_cleaned`, в котором будут удалены эти дубликаты. При удалении нужно оставить первую встретившуюся запись.
4. Выведет итоговое количество строк до и после очистки.

*****

Почему это работает:
Запрос детализирует задачу: не просто “удали дубли”, а покажи их, определи критерии дублирования (по конкретным столбцам) и сравни результат до и после. Такой подход обеспечивает контроль над процессом очистки.

4. Разведочный анализ данных (EDA)

Проблема:
Получен новый набор данных, и нужно быстро составить о нем первое впечатление: понять структуру, распределения, найти аномалии и основные зависимости.

Решение:
Этот комплексный промпт запускает полноценный разведочный анализ, результаты которого структурируются в удобный для чтения отчет.

Текст промпта:

*****

Ты – старший аналитик данных. Тебе предоставлен датасет [опишите датасет, например, “о клиентах телеком-компании”]. Переменные в датасете: [перечислите названия столбцов и, если возможно, их краткое описание]. Целевая переменная – [укажите целевую переменную, например, “`Churn` (отток)”].

Проведи комплексный разведочный анализ данных (EDA) и представь результаты в виде структурированного отчета. Отчет должен включать:
1. Общая информация: размер датасета, типы данных, количество пропусков по каждому столбцу.
2. Анализ числовых признаков: основные описательные статистики (среднее, медиана, стандартное отклонение, мин/макс) для каждого числового столбца. Построй гистограммы их распределений.
3. Анализ категориальных признаков: подсчет уникальных значений для каждого категориального столбца. Построй столбчатые диаграммы их частот.
4. Анализ целевой переменной: рассчитай и визуализируй дисбаланс классов.
5. Корреляционный анализ: построй тепловую карту корреляций Пирсона для всех числовых признаков.
6. Предварительные выводы: на основе анализа, сформулируй 3-5 ключевых наблюдений или гипотез для дальнейшего исследования.

Сгенерируй код на Python с использованием библиотек Pandas, Matplotlib и Seaborn для выполнения всех этих шагов.

*****

Почему это работает:
Это не просто запрос, а четкое техническое задание. Структура отчета задана заранее, что заставляет ИИ работать последовательно и выдавать полный, логичный и легко интерпретируемый результат. Это экономит часы ручной работы.

5. Генерация SQL-запроса с несколькими JOIN

Проблема:
Нужно собрать данные из нескольких связанных таблиц в базе данных, но написание сложных SQL-запросов с несколькими `JOIN` отнимает время и чревато ошибками.

Решение:
Промпт позволяет описать структуру таблиц и желаемый результат на естественном языке, а ИИ преобразует это в готовый и оптимизированный SQL-запрос.

Текст промпта:

*****

Ты – эксперт по SQL. Мне нужно написать запрос для СУБД [укажите СУБД, например, “PostgreSQL”]. У меня есть следующие таблицы:
1. `employees` (поля: `id`, `name`, `department_id`)
2. `departments` (поля: `id`, `department_name`)
3. `salaries` (поля: `employee_id`, `amount`, `date`)

Задача: написать один SQL-запрос, который выведет имена сотрудников, названия их отделов и их последнюю зарплату (самую свежую по полю `date`). Выводить нужно только сотрудников из отдела [укажите название отдела, например, “‘Разработка'”].

Результат должен содержать три столбца: `name`, `department_name`, `amount`.

*****

Почему это работает:
Промпт четко описывает “вход” (структура таблиц и их поля) и “выход” (требуемые столбцы и фильтры). Это полностью снимает с ИИ необходимость угадывать названия полей и логику связей, что ведет к точному результату.

6. Создание оконной функции в SQL

Проблема:
Нужно рассчитать сложные метрики, такие как скользящее среднее или ранг внутри группы, что требует использования оконных функций в SQL, синтаксис которых бывает неочевиден.

Решение:
Запрос генерирует SQL-код с оконной функцией, основываясь на описании задачи.

Текст промпта:

*****

Ты – SQL-разработчик. Напиши SQL-запрос с использованием оконной функции. У меня есть таблица `payments` с полями `user_id`, `payment_date`, `amount`.

Задача: для каждого пользователя рассчитать его ранг по сумме платежа внутри каждого дня. То есть, самый крупный платеж пользователя за день должен иметь ранг 1, второй по величине – 2, и так далее.

Итоговый запрос должен выводить `user_id`, `payment_date`, `amount` и новый столбец `daily_rank`. Используй диалект SQL для [укажите СУБД, например, “ClickHouse”].

*****

Почему это работает:
Промпт четко формулирует логику партиционирования (`PARTITION BY`) и упорядочивания (`ORDER BY`) для оконной функции, описывая бизнес-логику (“ранг по сумме платежа внутри каждого дня”). Это позволяет ИИ точно выбрать и настроить нужную функцию (`RANK()` или `DENSE_RANK()`).

7. Генерация кода для A/B-теста

Проблема:
Проведен A/B-тест, и нужно статистически грамотно проанализировать его результаты, чтобы принять верное бизнес-решение.

Решение:
Промпт генерирует полный пайплайн анализа A/B-теста на Python, включая расчет метрик, проверку статистической значимости и интерпретацию результатов.

Текст промпта:

*****

Ты – аналитик данных, специализирующийся на A/B-тестировании. У меня есть данные A/B-теста в CSV-файле с колонками: `user_id`, `group` (‘A’ – контроль, ‘B’ – тест), `converted` (1 – конверсия, 0 – нет).

Напиши скрипт на Python, который:
1. Загружает данные из файла.
2. Рассчитывает коэффициент конверсии для каждой группы (A и B).
3. Проводит t-тест (или Z-тест для пропорций) для определения, является ли разница в конверсиях статистически значимой.
4. Выводит p-value и четкий вывод: “Разница статистически значима” или “Статистически значимой разницы не обнаружено” при уровне значимости alpha = 0.05.
5. Объясни, что означает полученное p-value простым языком для менеджера.

*****

Почему это работает:
Промпт задает полный цикл анализа: от загрузки данных до интерпретации результатов для нетехнических специалистов. Указание конкретного статистического теста и уровня значимости делает результат точным и воспроизводимым.

8. Построение простой модели машинного обучения

Проблема:
Нужно быстро проверить гипотезу или построить базовую предиктивную модель, не тратя много времени на написание всего кода с нуля.

Решение:
Запрос генерирует код для обучения и оценки простой модели (например, логистической регрессии) “под ключ”.

Текст промпта:

*****

Ты – специалист по машинному обучению. Напиши скрипт на Python с использованием Scikit-learn для построения модели классификации.

Данные: DataFrame `df`, где `X` – это признаки [перечислите названия столбцов-признаков], а `y` – это целевая переменная [название целевого столбца] (бинарная: 0 или 1).

Скрипт должен выполнить следующие шаги:
1. Разделить данные на обучающую и тестовую выборки в соотношении 80/20.
2. Обучить модель логистической регрессии (`LogisticRegression`) на обучающей выборке.
3. Сделать предсказания на тестовой выборке.
4. Рассчитать и вывести основные метрики качества: accuracy, precision, recall, F1-score и ROC-AUC.
5. Построить и отобразить матрицу ошибок (confusion matrix).

*****

Почему это работает:
Запрос предоставляет четкий и стандартный пайплайн для задачи классификации. Указание конкретной модели и списка метрик гарантирует, что ИИ сгенерирует полный и корректный код для оценки качества модели.

9. Генерация синтетических данных

Проблема:
Нужно протестировать скрипт, алгоритм или визуализацию, но реальных данных под рукой нет, или их нельзя использовать из-за соображений конфиденциальности.

Решение:
Промпт создает датафрейм с нужной структурой и характером распределений, который можно использовать для любых тестов.

Текст промпта:

*****

Ты – генератор данных. Создай DataFrame в Pandas на 1000 строк, имитирующий данные о пользователях. DataFrame должен содержать следующие столбцы:
– `user_id`: уникальный идентификатор от 1 до 1000.
– `age`: возраст, распределенный нормально со средним 30 и стандартным отклонением 8. Значения должны быть целыми числами от 18 до 65.
– `city`: город, случайный выбор из списка [“Москва”, “Санкт-Петербург”, “Новосибирск”, “Екатеринбург”, “Казань”].
– `registration_date`: дата регистрации, случайная дата в пределах 2022 года.
– `balance`: баланс на счете, случайное число с плавающей точкой от 0 до 50000.

Сгенерируй код на Python, который создает такой DataFrame.

*****

Почему это работает:
Промпт очень конкретен: он указывает не только названия и типы столбцов, но и характер распределения данных (нормальное для возраста), конкретные значения (список городов) и диапазоны. Это позволяет получить реалистичные данные для тестирования.

10. Написание парсера для веб-страницы

Проблема:
Нужно извлечь структурированную информацию с веб-страницы (например, цены, названия товаров), но писать парсер вручную долго и утомительно.

Решение:
Запрос генерирует Python-код для парсинга, который можно легко адаптировать под нужную страницу, указав CSS-селекторы или теги.

Текст промпта:

*****

Ты – Python-разработчик, эксперт по веб-скрапингу. Напиши скрипт на Python с использованием библиотек `requests` и `BeautifulSoup4` для парсинга данных с веб-страницы.

Целевая страница: [URL страницы, например, “https://ru.wikipedia.org/wiki/Список_городов-миллионеров_России”].

Задача: извлечь таблицу с городами-миллионерами. Для каждой строки таблицы нужно получить название города и его население.

Результат сохрани в виде списка словарей, где каждый словарь представляет один город. Например: `[{‘city’: ‘Москва’, ‘population’: ‘13104177’}, …]`.

Укажи в коде, какие теги и классы ты используешь для поиска таблицы и извлечения данных.

*****

Почему это работает:
Промпт указывает конкретный URL, библиотеки и, самое главное, желаемую структуру выходных данных. Просьба указать селекторы заставляет ИИ явно прописать логику поиска, что упрощает отладку и адаптацию кода.

11. Рефакторинг и оптимизация кода

Проблема:
Есть работающий, но медленный или трудночитаемый Python-скрипт, который нужно улучшить.

Решение:
ИИ выступает в роли опытного ревьюера: анализирует код, находит узкие места и предлагает более эффективные и “пайтоник” решения.

Текст промпта:

*****

Ты – старший Python-разработчик с опытом оптимизации кода. Проведи рефакторинг следующего фрагмента кода.

Цель: сделать код более читаемым (согласно PEP8), эффективным и “пайтоник”.

Вот исходный код:
“`python
[вставьте сюда ваш медленный или некрасивый код, например, цикл for, который можно заменить на векторизованную операцию Pandas]“`

Твоя задача:
1. Переписать код, применив лучшие практики.
2. Добавить комментарии, объясняющие, какие именно улучшения были сделаны и почему (например, “заменил цикл for на векторизованную операцию, так как это работает в разы быстрее на больших объемах данных”).
3. Указать на потенциальные “бутылочные горлышки” в исходном коде.

*****

Почему это работает:
Промпт не просто просит “улучшить”, а ставит конкретные цели (читаемость, эффективность) и требует объяснить внесенные изменения. Это не только дает оптимизированный код, но и обучает лучшим практикам программирования.

12. Создание интерактивной визуализации

Проблема:
Статичные графики не всегда позволяют глубоко исследовать данные. Нужен интерактивный дашборд, где можно фильтровать и детализировать информацию.

Решение:
Запрос генерирует код для создания интерактивного графика или простого дашборда с помощью библиотек Plotly или Altair.

Текст промпта:

*****

Ты – специалист по визуализации данных. Напиши код на Python для создания интерактивной визуализации с помощью библиотеки `Plotly Express`.

У меня есть DataFrame `df` с данными о [опишите данные, например, “продажах автомобилей”] со столбцами: `brand`, `model`, `price`, `year`, `mileage`.

Задача: создать диаграмму рассеяния (scatter plot), где:
– Ось X – `mileage` (пробег).
– Ось Y – `price` (цена).
– Цвет точек соответствует `brand` (марка).
– Размер точек соответствует `year` (год выпуска).
– При наведении на точку отображается информация о `model`.

Добавь к графику заголовок “Зависимость цены от пробега и года выпуска”.

*****

Почему это работает:
Промпт детально описывает “мэппинг” переменных из данных на визуальные элементы графика (оси, цвет, размер, всплывающие подсказки). Это позволяет ИИ однозначно понять задачу и использовать все возможности библиотеки для создания насыщенной интерактивной визуализации.

13. Поиск аномалий в данных

Проблема:
В данных могут присутствовать выбросы или аномальные значения, которые необходимо обнаружить перед построением модели или анализом.

Решение:
Промпт предлагает использовать один из классических методов для поиска аномалий (например, метод межквартильного размаха) и генерирует код для его применения.

Текст промпта:

*****

Ты – аналитик данных, специализирующийся на поиске аномалий. У меня есть DataFrame `df` и числовой столбец `[укажите название столбца, например, ‘transaction_amount’]`, в котором я хочу найти выбросы.

Напиши код на Python (Pandas), который реализует метод поиска аномалий на основе межквартильного размаха (IQR).

Алгоритм:
1. Рассчитай первый (Q1) и третий (Q3) квартили для указанного столбца.
2. Рассчитай межквартильный размах (IQR = Q3 – Q1).
3. Определи границы для выбросов: `lower_bound = Q1 – 1.5 * IQR` и `upper_bound = Q3 + 1.5 * IQR`.
4. Найди и выведи все строки DataFrame, где значение в указанном столбце выходит за эти границы.
5. Объясни простыми словами, почему именно коэффициент 1.5 используется в этом методе.

*****

Почему это работает:
Промпт дает ИИ точный и общепринятый алгоритм действий. Просьба объяснить теоретическую основу метода (коэффициент 1.5) заставляет нейросеть предоставить не только код, но и полезный контекст, улучшающий понимание процесса.

14. Проведение когортного анализа

Проблема:
Нужно проанализировать удержание пользователей (retention), сгруппировав их по времени регистрации или первой покупки (когорты).

Решение:
Этот сложный промпт генерирует полный код для расчета и визуализации когортного анализа Retention Rate.

Текст промпта:

*****

Ты – Senior Data Analyst. Мне нужно провести когортный анализ удержания пользователей. У меня есть DataFrame `df` с данными о действиях пользователей. В нем есть столбцы:
– `user_id`: ID пользователя
– `event_date`: дата действия пользователя (тип datetime)

Напиши скрипт на Python (с использованием Pandas), который:
1. Для каждого `user_id` найдет дату его первой активности (дату формирования когорты).
2. Создаст столбец с названием когорты в формате ‘ГГГГ-ММ’.
3. Рассчитает “возраст” каждой активности в месяцах относительно даты формирования когорты.
4. Построит сводную таблицу (pivot table), где строками будут когорты, столбцами – “возраст” когорты в месяцах, а значениями – количество уникальных пользователей.
5. Преобразует эту таблицу в retention-матрицу (в процентах от исходного размера когорты).
6. Визуализирует полученную retention-матрицу с помощью тепловой карты (heatmap) из библиотеки Seaborn с аннотациями.

Код должен быть подробно прокомментирован на каждом шаге.

*****

Почему это работает:
Когортный анализ – многоступенчатый процесс. Промпт разбивает его на четкие, логически связанные шаги. Это один из тех случаев, где подробное ТЗ для ИИ экономит несколько часов сложной и кропотливой работы.

15. Объяснение результатов модели для бизнеса

Проблема:
Построена сложная модель машинного обучения, но ее результаты нужно объяснить менеджерам или заказчикам на простом и понятном языке, без технических терминов.

Решение:
Промпт заставляет ИИ выступить в роли “переводчика” с технического языка на язык бизнеса, интерпретируя метрики и результаты модели.

Текст промпта:

*****

Ты – связующее звено между командой аналитиков и бизнес-руководством. Мы построили модель, которая предсказывает отток клиентов. Вот ее ключевые показатели:
– Precision: 0.85
– Recall: 0.70
– ROC-AUC: 0.92
– Самые важные признаки, влияющие на предсказание: “длительность контракта”, “сумма ежемесячного платежа”, “наличие техподдержки”.

Твоя задача – написать короткое (2-3 абзаца) объяснение этих результатов для генерального директора, который не разбирается в машинном обучении.

В своем объяснении:
– Не используй слова “precision”, “recall”, “ROC-AUC”.
– Объясни на простых примерах, что означают эти цифры. Например: “Из 100 клиентов, которых модель пометила как ‘уходящих’, 85 действительно собирались уйти”.
– Сделай акцент на практической пользе: как мы можем использовать эту модель для удержания клиентов, опираясь на важные признаки.
– Тон должен быть деловым, но понятным.

*****

Почему это работает:
Промпт четко определяет целевую аудиторию (директор) и ее ограничения (не знает терминов). Он заставляет ИИ сфокусироваться не на технических деталях, а на бизнес-ценности и практическом применении результатов анализа.

16. Генерация регулярного выражения

Проблема:
Нужно извлечь или проверить данные, соответствующие сложному шаблону (например, email-адреса, артикулы товаров), а составлять “регулярки” вручную – то еще удовольствие.

Решение:
ИИ генерирует готовое регулярное выражение на основе описания и примеров.

Текст промпта:

*****

Ты – эксперт по регулярным выражениям. Создай регулярное выражение, которое находит артикулы товаров в тексте.

Формат артикула:
– Начинается с 2-3 заглавных латинских букв (префикс).
– Затем идет дефис (-).
– Затем 5-7 цифр.
– Может заканчиваться необязательным суффиксом в виде дефиса и одной заглавной буквы (например, -A).

Примеры для совпадения: “AB-12345”, “CDE-9876543”, “XYZ-55555-B”.
Примеры, которые не должны совпадать: “ab-12345”, “CDE-123”, “XYZ-55555-bb”.

Предоставь только само регулярное выражение и краткое объяснение его частей.

*****

Почему это работает:
Ключ к успеху – предоставление как положительных, так и отрицательных примеров. Это помогает ИИ точнее понять границы шаблона и избежать распространенных ошибок в составлении регулярных выражений.

17. Прогнозирование временных рядов

Проблема:
Есть данные за прошлые периоды (например, продажи, трафик), и нужно построить прогноз на будущее.

Решение:
Промпт генерирует код для построения простой прогностической модели временного ряда, например, SARIMA.

Текст промпта:

*****

Ты – специалист по анализу временных рядов. У меня есть временной ряд в виде Pandas Series с ежедневными данными о [опишите данные, например, “количестве посетителей сайта”] за последние 3 года. Индекс – datetime.

Напиши код на Python, который:
1. Использует библиотеку `statsmodels` для построения модели SARIMA.
2. Автоматически подбирает оптимальные параметры (p, d, q) и сезонные параметры (P, D, Q, s) с помощью функции `auto_arima` из библиотеки `pmdarima`. Считай, что сезонность годовая (s=12 для месячных данных, но здесь надо адаптировать для дневных, возможно, s=7 для недельной).
3. Обучает модель на всех доступных данных.
4. Строит прогноз на следующие [укажите период, например, “30 дней”].
5. Визуализирует исторические данные, прогноз и доверительный интервал на одном графике.

*****

Почему это работает:
Промпт не заставляет пользователя подбирать сложные параметры модели вручную, а предлагает использовать для этого автоматизированные инструменты (`auto_arima`). Это значительно упрощает задачу и делает ее доступной даже для неспециалистов во временных рядах.

18. Сегментация клиентов (RFM-анализ)

Проблема:
Нужно сегментировать клиентскую базу по их покупательской активности, чтобы выстроить персонализированные коммуникации.

Решение:
Запрос генерирует полный код для проведения RFM-анализа – классического метода сегментации клиентов.

Текст промпта:

*****

Ты – маркетолог-аналитик. Проведи RFM-анализ клиентской базы. У меня есть DataFrame `df` с историей транзакций, содержащий столбцы:
– `CustomerID`
– `InvoiceDate` (дата покупки, тип datetime)
– `Quantity` (количество товара)
– `UnitPrice` (цена за единицу)

Напиши скрипт на Python, который:
1. Рассчитывает общую сумму каждой покупки.
2. Устанавливает текущую дату для анализа (например, на один день позже последней даты в данных).
3. Для каждого `CustomerID` рассчитывает три метрики:
– Recency (R): количество дней с последней покупки.
– Frequency (F): общее количество покупок.
– Monetary (M): общая сумма денег, потраченная клиентом.
4. Сегментирует клиентов, присваивая им ранги от 1 до 4 по каждой из метрик (R, F, M) на основе квантилей.
5. Объединяет ранги в RFM-сегменты (например, “444” – лучшие клиенты, “111” – ушедшие).
6. Выводит итоговый DataFrame с `CustomerID` и его RFM-метриками/сегментами.

*****

Почему это работает:
RFM-анализ, как и когортный, является стандартным, но многошаговым процессом. Промпт четко раскладывает его на атомарные операции, что гарантирует получение корректного и полного решения “под ключ”.

19. Подготовка текста для NLP-задач

Проблема:
Есть массив текстовых данных (отзывы, комментарии), который нужно подготовить для дальнейшего анализа или моделирования (например, для сентимент-анализа).

Решение:
Промпт генерирует функцию для предобработки текста: токенизация, лемматизация, удаление стоп-слов.

Текст промпта:

*****

Ты – NLP-инженер. Напиши функцию на Python для предобработки русского текста. Функция должна принимать на вход одну строку текста.

Этапы обработки:
1. Привести текст к нижнему регистру.
2. Удалить все символы, кроме букв русского алфавита и пробелов.
3. Токенизировать текст (разбить на слова).
4. Удалить стоп-слова. Используй готовый список стоп-слов из библиотеки `nltk` для русского языка.
5. Провести лемматизацию каждого слова (привести к начальной форме). Используй библиотеку `pymorphy2`.
6. Вернуть строку, состоящую из обработанных токенов, соединенных пробелом.

Код должен быть снабжен комментариями, объясняющими каждый шаг.

*****

Почему это работает:
Промпт четко указывает последовательность шагов и конкретные библиотеки (`nltk`, `pymorphy2`), которые являются стандартом для обработки русского языка. Это позволяет получить рабочий и эффективный код для типичной NLP-задачи.

20. Генерация запроса к API

Проблема:
Нужно получить данные из внешнего источника через REST API, но не хочется разбираться в документации и писать код для запроса с нуля.

Решение:
Промпт генерирует Python-код для отправки GET-запроса к API и обработки ответа.

Текст промпта:

*****

Ты – Python-разработчик. Напиши скрипт, который получает данные из публичного API.

API-эндпоинт: [укажите URL эндпоинта, например, “https://api.exchangerate-api.com/v4/latest/USD”].
Задача: отправить GET-запрос к этому API, получить ответ в формате JSON, извлечь из него [укажите, что нужно извлечь, например, “курс рубля (RUB)”] и вывести на экран.

Используй библиотеку `requests`. Добавь в код обработку возможных ошибок (например, если сервер недоступен или вернул ошибку).

*****

Почему это работает:
Промпт предоставляет всю необходимую информацию: URL, метод запроса (подразумевается GET), что нужно извлечь из ответа. Просьба обработать ошибки делает сгенерированный код более надежным и готовым к использованию.

21. Сравнение двух датафреймов

Проблема:
Есть два набора данных, которые должны быть идентичными, и нужно быстро найти расхождения между ними.

Решение:
ИИ генерирует код на Pandas, который находит различия в данных, структуре или значениях двух DataFrame.

Текст промпта:

*****

Ты – QA-инженер в аналитике. У меня есть два Pandas DataFrame: `df1` и `df2`. Они должны быть идентичны, но я подозреваю, что есть расхождения.

Напиши код на Python, который:
1. Сравнивает названия и порядок столбцов. Если они не совпадают, выводит различия.
2. Сравнивает типы данных в столбцах. Если есть расхождения, выводит их.
3. Если структура совпадает, находит и выводит строки, которые присутствуют в `df1`, но отсутствуют в `df2` (и наоборот), используя определенный столбец как ключ (`[укажите ключевой столбец, например, ‘id’]`).
4. Для строк с одинаковым ключом находит и выводит ячейки, значения в которых не совпадают.

*****

Почему это работает:
Промпт разбивает сложную задачу “сравнить все” на конкретные проверки: столбцы, типы, отсутствующие строки и различия в значениях. Это обеспечивает систематический и полный аудит данных.

22. Расчет LTV (Lifetime Value)

Проблема:
Нужно рассчитать пожизненную ценность клиента (LTV) – одну из ключевых метрик для оценки прибыльности бизнеса.

Решение:
Запрос генерирует код для расчета LTV на основе исторических данных о покупках и когортах.

Текст промпта:

*****

Ты – продуктовый аналитик. Мне нужно рассчитать LTV клиентов. У меня есть данные о транзакциях в DataFrame `df` со столбцами `CustomerID`, `InvoiceDate`, `TotalPrice`.

Напиши Python-скрипт для расчета LTV по когортам.
Алгоритм:
1. Определи когорту для каждого клиента по месяцу его первой покупки.
2. Рассчитай кумулятивный (накопительный) доход для каждой когорты по месяцам с момента первой покупки.
3. Раздели кумулятивный доход на количество клиентов в когорте, чтобы получить средний LTV по “возрасту” когорты.
4. Представь результат в виде сводной таблицы, где строки – когорты, а столбцы – месяцы жизни когорты (0, 1, 2…).
5. Визуализируй LTV нескольких ключевых когорт на одном линейном графике.

*****

Почему это работает:
Промпт задает классический и методологически верный способ расчета LTV через когортный анализ. Четкое описание шагов и формата результата позволяет ИИ сгенерировать сложный, но корректный аналитический код.

23. Объяснение сложного SQL-запроса

Проблема:
Вы получили от коллеги сложный SQL-запрос с вложенными подзапросами, оконными функциями и CTE, и не можете быстро понять, что он делает.

Решение:
ИИ анализирует SQL-код и объясняет его логику по шагам на простом языке.

Текст промпта:

*****

Ты – SQL-ментор. Объясни, что делает следующий SQL-запрос. Разбери его логику по шагам, как если бы ты объяснял это младшему аналитику.

Вот запрос:
“`sql
[вставьте сюда ваш сложный SQL-запрос]“`

Формат объяснения:
1. Общая цель запроса: Что он пытается вычислить в итоге?
2. Разбор по частям (CTE, подзапросы): Объясни, что вычисляется в каждой временной таблице (блок `WITH`) или подзапросе.
3. Логика соединений (JOINs): Как таблицы связаны друг с другом.
4. Финальная агрегация и фильтрация: Что происходит на последнем шаге.

Используй простой язык, избегай излишнего жаргона.

*****

Почему это работает:
Промпт заставляет ИИ структурировать объяснение, двигаясь от общего к частному. Это превращает монолитный и пугающий код в последовательность понятных логических шагов, что идеально для обучения и ревью кода.

24. Создание дашборда в Streamlit

Проблема:
Нужно быстро создать простой интерактивный веб-дашборд для демонстрации результатов анализа, не погружаясь в веб-разработку.

Решение:
Промпт генерирует готовый к запуску скрипт для создания дашборда на популярной библиотеке Streamlit.

Текст промпта:

*****

Ты – Python-разработчик, создающий аналитические приложения. Напиши скрипт `app.py` для простого дашборда с использованием библиотеки `streamlit`.

У меня есть датасет `data.csv` со столбцами `country`, `year`, `population`.

Дашборд должен содержать:
1. Заголовок: “Динамика населения по странам”.
2. Селект-бокс (выпадающий список) на боковой панели для выбора страны (`st.sidebar.selectbox`). Список стран должен формироваться из данных.
3. При выборе страны дашборд должен отфильтровать данные и построить линейный график (`st.line_chart`), показывающий динамику населения (`population`) по годам (`year`) для выбранной страны.
4. Под графиком должна отображаться таблица (`st.dataframe`) с отфильтрованными данными.

Сгенерируй полный и готовый к запуску код.

*****

Почему это работает:
Промпт детально прописывает структуру и логику дашборда: какие элементы управления использовать (`selectbox`), где их разместить (на боковой панели) и как они должны влиять на отображаемые данные (фильтрация и обновление графика/таблицы).

25. Генерация документации для функции

Проблема:
Написана полезная, но сложная функция, и нужно создать для нее понятную документацию (docstring), чтобы другие могли ею пользоваться.

Решение:
ИИ анализирует код функции и генерирует для нее документацию в стандартном формате.

Текст промпта:

*****

Ты – технический писатель. Напиши подробную docstring для следующей Python-функции в формате Google Style.

Вот функция:
“`python
[вставьте сюда код вашей функции без документации]“`

Docstring должна включать:
– Краткое описание функции в одно предложение.
– Раздел `Args:` с описанием каждого аргумента, его типа и назначения.
– Раздел `Returns:` с описанием возвращаемого значения и его типа.
– (Опционально) Раздел `Raises:` с описанием возможных исключений.
– (Опционально) Пример использования в блоке `Example:`.

*****

Почему это работает:
Промпт указывает на конкретный и широко используемый стандарт оформления документации (Google Style). Это гарантирует, что результат будет не просто описанием, а структурированной и профессионально оформленной документацией, понятной другим разработчикам и инструментам.

26. Поиск оптимальных параметров для модели (Grid Search)

Проблема:
Эффективность модели машинного обучения сильно зависит от ее гиперпараметров. Подбирать их вручную долго и неэффективно.

Решение:
Промпт генерирует код для автоматического подбора гиперпараметров с помощью `GridSearchCV`.

Текст промпта:

*****

Ты – ML-инженер. У меня есть модель `XGBoost Classifier` для задачи бинарной классификации. Мне нужно найти оптимальные гиперпараметры для нее.

Напиши код на Python (с использованием Scikit-learn), который:
1. Определяет сетку параметров для перебора (`param_grid`). Включи в нее: `n_estimators` [50, 100, 200], `max_depth` [3, 5, 7], `learning_rate` [0.01, 0.1].
2. Создает экземпляр `GridSearchCV` с моделью `XGBClassifier`, сеткой параметров, 5-кратной кросс-валидацией (cv=5) и метрикой для оптимизации `roc_auc`.
3. Запускает поиск по сетке на обучающих данных `X_train`, `y_train`.
4. Выводит наилучшие найденные параметры (`best_params_`) и наилучший результат на кросс-валидации (`best_score_`).

*****

Почему это работает:
Промпт четко определяет модель, список параметров для перебора, метод валидации (кросс-валидация) и целевую метрику. Это все необходимые компоненты для корректного использования `GridSearchCV`, что позволяет получить готовый код для одной из самых важных задач в ML.

27. Разработка системы метрик для продукта

Проблема:
Запускается новый продукт или функция, и нужно определить ключевые метрики, по которым будет оцениваться его успешность.

Решение:
ИИ выступает в роли опытного продакт-менеджера и предлагает иерархическую систему метрик.

Текст промпта:

*****

Ты – опытный продуктовый аналитик. Мы запускаем новую функцию в нашем приложении [опишите приложение, например, “сервис доставки еды”]. Функция называется [название функции, например, “‘Групповой заказ'”].

Цель функции: [опишите цель, например, “позволить нескольким пользователям совместно формировать один заказ”].

Твоя задача – разработать систему метрик для оценки успешности этой функции. Представь метрики в виде “дерева” или иерархии:
1. North Star Metric (Метрика Полярной звезды): одна главная метрика, отражающая ценность для пользователя.
2. Продуктовые метрики (уровень 2): 3-4 метрики, которые влияют на North Star (например, adoption rate, engagement rate, retention rate).
3. Диагностические метрики (уровень 3): более низкоуровневые метрики, которые помогают понять, ПОЧЕМУ меняются метрики уровня 2 (например, среднее количество участников в групповом заказе, время формирования заказа, процент ошибок).

Для каждой метрики дай краткое определение и объясни, почему она важна.

*****

Почему это работает:
Промпт предлагает известную и эффективную структуру (иерархия метрик), что заставляет ИИ мыслить системно. Он не просто перечисляет метрики, а выстраивает их в логическую связь, от главной цели до конкретных операционных показателей.

28. Перевод бизнес-вопроса в аналитическую задачу

Проблема:
Менеджер приходит с очень общим вопросом вроде “Почему у нас упали продажи?”, и аналитику нужно декомпозировать его в конкретный план действий.

Решение:
Промпт помогает превратить абстрактный бизнес-вопрос в набор конкретных гипотез и шагов для их проверки.

Текст промпта:

*****

Ты – руководитель отдела аналитики. К тебе пришел менеджер по маркетингу с вопросом: “Почему в прошлом месяце конверсия в покупку на нашем сайте упала на 15%?”

Твоя задача – декомпозировать этот вопрос в четкий план аналитического исследования.

Представь свой ответ в виде списка:
1. Формулировка гипотез: предложи 5-7 возможных причин падения конверсии (например, “проблема в новом обновлении сайта”, “изменился состав трафика”, “сезонный спад”, “активность конкурентов”, “технические ошибки на странице оплаты”).
2. Необходимые данные: для каждой гипотезы укажи, какие данные нужны для ее проверки (например, “данные веб-аналитики по источникам трафика”, “логи ошибок”, “данные о версиях приложения”).
3. План анализа: опиши по шагам, что ты будешь делать для проверки каждой гипотезы (например, “сравню конверсию по сегментам трафика до и после падения”, “проанализирую воронку оформления заказа на предмет аномалий”).

*****

Почему это работает:
Этот промпт имитирует мыслительный процесс опытного аналитика. Он учит не бросаться сразу в данные, а сначала структурировать проблему, выдвинуть гипотезы и только потом определять методы их проверки. Это один из важнейших навыков в аналитике.

29. Написание ТЗ для разработчиков на основе анализа

Проблема:
Аналитик нашел проблему или точку роста (например, узкое место в воронке) и теперь ему нужно сформулировать задачу для команды разработки.

Решение:
ИИ помогает составить четкое техническое задание (ТЗ), которое будет понятно разработчикам.

Текст промпта:

*****

Ты – продуктовый аналитик, который ставит задачи в разработку. По результатам анализа я выяснил, что [опишите инсайт, например, “30% пользователей уходят со страницы оплаты, когда видят стоимость доставки”].

Мне нужно, чтобы ты на основе этого инсайта составил техническое задание для разработчиков на доработку.

ТЗ должно быть в формате User Story и включать:
1. Заголовок: краткое название задачи.
2. User Story: “Как [роль пользователя], я хочу [что сделать], чтобы [получить какую выгоду]”.
3. Обоснование: кратко изложи суть проблемы со ссылкой на данные (“По данным аналитики, мы теряем X% пользователей…”).
4. Критерии приемки (Acceptance Criteria): список конкретных условий, при выполнении которых задача считается сделанной (например, “Стоимость доставки теперь отображается в корзине ДО перехода к оплате”, “Пользователь видит итоговую сумму с учетом доставки”).
5. Требования к аналитике: какие события нужно отправлять в систему аналитики после внедрения фичи для оценки ее эффекта.

Тон должен быть четким, формальным и недвусмысленным.

*****

Почему это работает:
Промпт использует стандартный для IT-индустрии формат постановки задач (User Story, Acceptance Criteria). Это гарантирует, что разработчики правильно поймут суть проблемы, ее бизнес-контекст и критерии успешного выполнения, что снижает риски недопонимания.

Продвинутые команды для уточнения запросов в анализе данных

Помимо самих промптов, существуют специальные команды-модификаторы, которые помогают управлять поведением нейросети и получать более точные или креативные результаты. Вот некоторые из них, особенно полезные в работе аналитика.

Команда/Модификатор Описание Пример использования в промпте для аналитика
Мысли по шагам Заставляет ИИ сначала составить план действий, а затем следовать ему. Это повышает логичность и точность сложных ответов. “…Напиши Python-скрипт для когортного анализа. Прежде чем писать код, изложи свою логику и план действий по шагам.“
Задай мне уточняющие вопросы Если в вашем запросе не хватает информации, эта команда заставит ИИ не додумывать, а спросить вас о недостающих деталях. “…Мне нужен SQL-запрос для поиска оттока. Если тебе не хватает информации о структуре таблиц или определении оттока, задай мне уточняющие вопросы.“
Сгенерируй N вариантов Полезно, когда нет единственно верного решения. ИИ предложит несколько альтернативных подходов к задаче. “…Предложи стратегию для заполнения пропусков в столбце ‘доход’. Сгенерируй 3 разных варианта с обоснованием для каждого.“
Действуй как критик Просит ИИ найти слабые места, ошибки или потенциальные риски в предоставленном коде, гипотезе или плане. “Вот мой Python-код для A/B-теста. Действуй как строгий ревьюер и укажи на все потенциальные ошибки и недочеты в моей методологии и коде.“
Объясни как для [аудитория] Адаптирует сложность и стиль ответа под указанную аудиторию (например, “для пятиклассника”, “для маркетолога”, “для CTO”). “…Объясни, что такое p-value. Объясни это так, как будто рассказываешь менеджеру по продажам, который ничего не знает о статистике.“
Используй формат [формат] Прямое указание на желаемый формат вывода: JSON, Markdown, CSV, YAML и т.д. Помогает получить структурированный и машиночитаемый результат. “…Извлеки данные о товарах с этой страницы. Результат представь в виде списка объектов JSON, где каждый объект содержит поля ‘name’, ‘price’, ‘url’.“

Неочевидные советы по работе с ИИ для аналитика

Освоив базовые и продвинутые промпты для аналитика данных, можно пойти еще дальше. Есть несколько приемов, которые многие упускают, но которые могут серьезно повысить вашу продуктивность.

  1. Создавайте “персону” для всей сессии чата. Вместо того чтобы в каждом промпте писать “Ты – аналитик данных”, начните диалог с установочного промпта: “На протяжении всего нашего разговора ты будешь выступать в роли старшего специалиста по данным с 10-летним опытом в [ваша сфера, например, ‘электронной коммерции’]. Твои ответы должны быть точными, структурированными и подкреплены примерами кода”. Это настраивает модель на нужный лад для всей беседы.
  2. Используйте ИИ для генерации гипотез, а не только для их проверки. Когда вы не знаете, с чего начать анализ, попросите нейросеть помочь. Например: “В прошлом квартале LTV наших клиентов вырос на 15%. Сгенерируй 10 наиболее вероятных гипотез, которые могли бы это объяснить”. Это отличный способ расширить свой взгляд на проблему.
  3. Просите ИИ не только писать, но и документировать код. После того как нейросеть сгенерировала вам сложную функцию или SQL-запрос, следующим промптом попросите: “Теперь напиши подробную документацию (docstring) для этого кода” или “Объясни логику этого запроса по шагам”. Так вы получаете не только решение, но и понятное описание к нему.
  4. Применяйте “цепочку промптов” для сложных задач. Не пытайтесь решить все одним махом. Разбейте задачу на этапы и используйте вывод одного промпта как ввод для следующего. Например: 1) промпт на очистку данных; 2) промпт на разведочный анализ очищенных данных; 3) промпт на построение модели на основе результатов анализа.
  5. Используйте ИИ как спарринг-партнера для критики ваших идей. Прежде чем презентовать свои выводы команде, изложите их нейросети и попросите: “Действуй как скептически настроенный руководитель. Какие слабые места ты видишь в моей аргументации? Какие дополнительные вопросы ты бы задал?”. Это помогает подготовиться к реальным возражениям и укрепить свою позицию.
  6. Сохраняйте удачные промпты в личную библиотеку. Если вы нашли формулировку, которая идеально решает вашу типовую задачу, не надейтесь запомнить ее. Создайте документ или заметку, куда будете складывать свои лучшие шаблоны для нейросети в аналитике, сгруппировав их по темам. Через пару месяцев у вас будет мощный персональный инструмент.