ИИ-технологФлагман NP
ИИ-технолог

Промпты для анализа данных. 28 готовых примеров для генерации

От NP_Article

ИИ-технолог

Обучение управлению ИИ с 0 до мастерского уровня

250+ уроков Начато наполнение Без инфоцыган и воды

Многие аналитики смотрят на нейросети с надеждой и опаской одновременно. С одной стороны, это мощный инструмент. С другой – без правильного подхода он генерирует лишь красивые, но бесполезные отчеты. В этой статье собраны практические промпты для анализа данных, которые помогут превратить ИИ из генератора случайных чисел в вашего личного ассистента, экономящего часы работы.

Кажется, что достаточно просто попросить: “Проанализируй эти данные”. Но в ответ можно получить что угодно, кроме полезного результата. Проблема не в нейросети, а в качестве команды. Машина не умеет читать мысли, ей нужны четкие инструкции. Понимание, как их составить, – ключ к эффективной работе.

Эта статья создана для того, чтобы вы перестали тратить время на угадывание и начали получать предсказуемый, качественный результат. Здесь вы найдете:

  • Готовые шаблоны запросов для разных этапов анализа.
  • Примеры для очистки данных, поиска инсайтов и визуализации.
  • Объяснение, почему именно такие формулировки работают.
  • Способы избежать типичных ошибок новичков.

Цель – дать вам набор инструментов, которые можно скопировать, вставить и адаптировать под свои задачи. Чтобы вы могли поручить рутину машине, а себе оставить самое интересное – интерпретацию результатов и принятие решений.

Типичные ошибки при составлении запросов для ИИ-аналитики

Прежде чем переходить к готовым решениям, важно понять, чего делать не стоит. Многие наступают на одни и те же грабли, а потом разочаровываются в технологии. Давайте разберем самые частые промахи, чтобы вы могли их избежать.

  1. Давать слишком общие и расплывчатые команды. Запрос “Проанализируй продажи” – это путь в никуда. Нейросеть не знает, что именно вас интересует: динамика по месяцам, самые прибыльные товары или портрет покупателя. В итоге вы получите поверхностный ответ, который придется уточнять еще десять раз.
  2. Не предоставлять контекст и структуру данных. ИИ не видит ваш файл и не знает, что означают столбцы ‘col_1’ и ‘user_rev_total’. Без описания полей, их типов и возможной связи между ними анализ будет основан на догадках. И, скорее всего, неверных.
  3. Забывать указать формат желаемого результата. Если не попросить ответ в виде таблицы, кода на Python или списка, нейросеть выдаст его в виде сплошного текста. Вам придется тратить дополнительное время на то, чтобы структурировать эту информацию вручную.
  4. Слепо доверять первому полученному ответу. Нейросеть может “галлюцинировать” – придумывать факты, допускать ошибки в расчетах или предлагать неоптимальный код. Ведь она никогда не ошибается, это всем известно. Всегда проверяйте результаты, особенно если они касаются важных бизнес-метрик.
  5. Пропускать этап очистки и подготовки данных. Пытаться анализировать “грязные” данные – все равно что строить дом на болоте. Если вы не дадите ИИ инструкции по обработке пропусков, дубликатов и аномалий, итоговые выводы будут искажены.
  6. Использовать один гигантский промпт для сложной задачи. Вместо того чтобы пытаться решить все одним махом, разбейте большую задачу на несколько маленьких шагов. Поэтапное выполнение (очистка, затем анализ, затем визуализация) дает гораздо более контролируемый и качественный результат.
  7. Не уточнять целевую аудиторию для отчета. Анализ для технического директора и для отдела маркетинга – это два разных документа. Не указав, для кого готовится отчет, вы получите универсальный, но никому не подходящий текст.

Сравнение слабых и сильных промптов для задач аналитика

Разница между хорошим и плохим запросом может быть колоссальной. Давайте на конкретных примерах посмотрим, как небольшое уточнение меняет результат с “бесполезно” на “отлично”. Это поможет вам развить правильное мышление при работе с ИИ.

Задача Слабый промпт (чего стоит избегать) Сильный промпт (как надо делать) Почему сильный промпт работает лучше
Очистка данных Почисти мой датасет. Ты – специалист по обработке данных. Вот фрагмент датасета в формате CSV. Напиши скрипт на Python с использованием pandas для его очистки. Замени пропуски в столбце ‘Возраст’ медианным значением, а в столбце ‘Город’ – модой. Удали полные дубликаты строк. Сильный промпт задает роль, указывает инструменты (Python, pandas), дает четкие инструкции по обработке пропусков и дубликатов. Слабый промпт – это крик в пустоту.
Поиск аномалий Найди выбросы. Проанализируй столбец ‘Сумма_транзакции’ в предоставленных данных. Используй метод межквартильного размаха (IQR) для определения аномально высоких значений (выбросов). Верни список идентификаторов транзакций, которые попадают под это определение. Сильный промпт указывает на конкретный столбец, задает статистический метод (IQR) и определяет формат вывода (список ID). Слабый промпт не дает никакой конкретики, заставляя ИИ гадать.
Базовая статистика Дай статистику по данным. Ты – аналитик данных. Для датасета с информацией о клиентах рассчитай описательную статистику (среднее, медиана, стандартное отклонение, минимум, максимум) для числовых столбцов ‘Доход’, ‘Количество_покупок’. Для категориального столбца ‘Сегмент’ посчитай частоту каждого значения. Ответ представь в виде таблицы. Сильный промпт четко перечисляет, какие именно статистические показатели нужны, для каких столбцов, и в каком виде представить результат. Это устраняет двусмысленность и дает готовый к использованию ответ.
Генерация гипотез Придумай гипотезы. Ты – маркетолог-аналитик. На основе данных о поведении пользователей на сайте (столбцы: ‘Время_на_странице’, ‘Количество_просмотренных_страниц’, ‘Источник_трафика’, ‘Конверсия’) сформулируй 3 гипотезы для A/B-тестирования, направленные на увеличение конверсии. Каждая гипотеза должна быть в формате “Если мы сделаем X, то это приведет к Y, потому что Z”. Сильный промпт задает роль и цель (увеличение конверсии), указывает на исходные данные и требует структурированного ответа по конкретному шаблону. Это гарантирует получение практичных и проверяемых идей.

28 готовых промптов для анализа данных на все случаи жизни

Теперь перейдем к самому главному – коллекции готовых запросов. Они разделены по этапам аналитической работы: от подготовки данных до финальной интерпретации. Адаптируйте их под свои задачи, меняя переменные в квадратных скобках.

1. Генерация кода для загрузки данных

Проблема: Нужно быстро написать код для загрузки данных из файла определенного формата, но не хочется вспоминать синтаксис.

Решение: Промпт генерирует готовый скрипт на Python для чтения файла с учетом всех нюансов.

Текст промпта:

*****

Ты – опытный Python-разработчик, специализирующийся на анализе данных. Твоя задача – написать код для загрузки данных.

Контекст:
Мне нужно загрузить данные из файла в DataFrame библиотеки pandas.

Требования:

  1. Язык программирования: Python.
  2. Библиотека: pandas.
  3. Напиши код для чтения файла формата [укажите формат, например, “CSV”, “Excel”, “JSON”].
  4. Путь к файлу: [укажите путь к файлу, например, “data/sales.csv”].
  5. Если это CSV, учти, что разделителем является [укажите разделитель, например, “;”, “,”, “t”].
  6. Если это Excel, укажи, какой лист нужно прочитать: [укажите имя или номер листа, например, “Лист1” или 0].
  7. Кодировка файла: [укажите кодировку, например, “utf-8” или “windows-1251”].
  8. Выведи на экран первые 5 строк загруженного датафрейма для проверки.

Ограничения: Не предлагай альтернативных библиотек, используй только pandas.

*****

Почему это работает: Промпт содержит все необходимые параметры (формат, путь, разделитель, кодировка), что позволяет ИИ сгенерировать точный и сразу рабочий код, избавляя от необходимости отладки.

2. Изучение структуры датасета

Проблема: Вы получили новый набор данных и нужно быстро понять, что он из себя представляет: сколько в нем строк, какие столбцы, какие типы данных.

Решение: Запрос просит ИИ сгенерировать код, который выведет всю основную сводную информацию о датафрейме.

Текст промпта:

*****

Ты – аналитик данных. Твоя задача – помочь мне быстро изучить структуру нового датасета, который уже загружен в pandas DataFrame с именем `df`.

Напиши код на Python, который последовательно выполнит следующие действия:

  1. Выведет размерность датафрейма (количество строк и столбцов).
  2. Покажет список всех столбцов.
  3. Выведет информацию о типах данных в каждом столбце и количестве непустых значений (используй метод .info()).
  4. Покажет первые 10 строк данных для визуального ознакомления.

Формат ответа: Предоставь единый блок кода с комментариями к каждому шагу.

*****

Почему это работает: Запрос структурирован как последовательность четких шагов. Это позволяет получить комплексный “паспорт” данных за одно действие, что является стандартной первой процедурой в любом разведочном анализе.

3. Поиск и подсчет пропущенных значений

Проблема: Пропуски в данных могут исказить результаты анализа. Нужно быстро найти все столбцы с пропусками и оценить их количество.

Решение: Промпт генерирует код для подсчета пропущенных значений в каждом столбце и их доли от общего числа.

Текст промпта:

*****

Ты – специалист по качеству данных. Проанализируй pandas DataFrame с именем `df` на предмет пропущенных значений.

Задача: Напиши код на Python, который:

  1. Для каждого столбца в df посчитает общее количество пропущенных значений (NaN).
  2. Для каждого столбца посчитает долю пропущенных значений в процентах.
  3. Выведет результат в виде сводной таблицы из двух столбцов: “Количество пропусков” и “Доля пропусков, %”.
  4. Отсортирует таблицу по убыванию количества пропусков.

Ограничения: Не удаляй и не заполняй пропуски, только найди и посчитай их.

*****

Почему это работает: Промпт запрашивает не только абсолютное, но и относительное количество пропусков (в процентах). Это гораздо информативнее и помогает принять взвешенное решение о том, как обрабатывать каждый столбец.

4. Генерация стратегии по заполнению пропусков

Проблема: Вы нашли пропуски, но не уверены, какой метод заполнения лучше всего подойдет для каждого столбца.

Решение: ИИ предлагает аргументированную стратегию по обработке пропусков на основе типов данных и их возможного смысла.

Текст промпта:

*****

Ты – опытный дата-сайентист. Мне нужна твоя помощь в разработке стратегии по обработке пропущенных значений в моем датасете.

Контекст: У меня есть датасет со следующими столбцами и типами данных: [перечислите столбцы с пропусками и их типы, например: “Возраст (числовой, float), Город (категориальный, object), Доход (числовой, float), Дата_регистрации (дата, datetime)”].

Задача: Предложи стратегию по заполнению пропусков для каждого из перечисленных столбцов. Для каждого столбца:

  1. Предложи подходящий метод (например, заполнение средним, медианой, модой, константой, или использование модели для предсказания).
  2. Кратко объясни, почему именно этот метод является предпочтительным для данного столбца.

Формат ответа: Представь ответ в виде маркированного списка, где каждый пункт – это столбец и твоя рекомендация.

*****

Почему это работает: Промпт заставляет ИИ не просто дать ответ, а объяснить свою логику (“почему этот метод”). Это учит пользователя лучшим практикам и позволяет принять более осознанное решение, а не слепо следовать совету.

5. Удаление дубликатов

Проблема: В данных могут быть повторяющиеся строки, которые могут исказить статистику и результаты моделирования.

Решение: Промпт генерирует код, который находит и удаляет дубликаты, а также сообщает, сколько строк было удалено.

Текст промпта:

*****

Ты – Python-программист. Напиши скрипт для удаления дубликатов из pandas DataFrame `df`.

Задача:

  1. Сначала определи и выведи на экран количество полных дубликатов строк в датафрейме.
  2. Затем удали все полные дубликаты.
  3. После удаления выведи новую размерность датафрейма, чтобы можно было оценить, сколько строк было удалено.
  4. Если мне нужно удалить дубликаты только на основе определенных столбцов, как мне изменить код? Приведи пример для столбцов [укажите примеры столбцов, например, “‘ID_пользователя’, ‘Дата_покупки'”].

Формат ответа: Предоставь код с комментариями.

*****

Почему это работает: Запрос не только решает основную задачу (удаление полных дубликатов), но и предвосхищает следующий возможный вопрос пользователя (“а как удалить дубликаты по конкретным столбцам?”), что делает ответ более полным и полезным.

6. Расчет описательных статистик

Проблема: Нужно получить базовую статистическую сводку по числовым данным: среднее, медиану, стандартное отклонение и т.д.

Решение: Промпт генерирует код для расчета всех основных описательных статистик для указанных столбцов.

Текст промпта:

*****

Ты – аналитик данных. Мне нужно провести разведочный анализ данных (EDA).

Задача: Напиши код на Python (используя pandas), который рассчитает и выведет на экран описательные статистики для числовых столбцов в DataFrame df.

  1. Список интересующих столбцов: [перечислите столбцы, например, “‘Цена’, ‘Количество’, ‘Рейтинг'”].
  2. Статистики, которые нужно рассчитать: количество значений, среднее, стандартное отклонение, минимальное, 25-й перцентиль, медиана (50-й перцентиль), 75-й перцентиль, максимальное значение.
  3. Результат должен быть выведен в удобной для чтения табличной форме (стандартный вывод метода .describe() подходит).

Ограничения: Рассчитай статистики только для перечисленных столбцов.

*****

Почему это работает: Четкое указание столбцов и перечень необходимых статистик гарантирует, что ИИ не будет рассчитывать лишнего и предоставит результат именно в том виде, который нужен для стандартного разведочного анализа.

7. Анализ распределения категориальных признаков

Проблема: Нужно понять, как распределены значения в категориальных столбцах – какие категории встречаются чаще, а какие реже.

Решение: Промпт генерирует код для подсчета частоты каждого уникального значения в указанных столбцах.

Текст промпта:

*****

Ты – аналитик данных. Проведи анализ категориальных признаков в DataFrame `df`.

Задача: Для каждого столбца из списка [укажите список категориальных столбцов, например, “‘Город’, ‘Тип_подписки’, ‘Источник_трафика'”] выполни следующее:

  1. Посчитай количество вхождений каждого уникального значения (частоту).
  2. Посчитай долю каждого уникального значения в процентах.
  3. Выведи результаты для каждого столбца по отдельности, сопроводив их названием столбца.

Формат ответа: Код на Python с использованием pandas.

*****

Почему это работает: Запрос требует рассчитать не только абсолютные частоты, но и относительные (проценты), что сразу дает понимание масштаба распределения. Раздельный вывод для каждого столбца делает отчет чистым и легко читаемым.

8. Построение корреляционной матрицы

Проблема: Необходимо выявить линейные взаимосвязи между числовыми переменными в датасете.

Решение: Промпт генерирует код для расчета и визуализации корреляционной матрицы.

Текст промпта:

*****

Ты – специалист по анализу данных. Твоя задача – помочь мне найти взаимосвязи между переменными в DataFrame `df`.

Задача:

  1. Напиши код на Python, который рассчитывает матрицу корреляций Пирсона для всех числовых столбцов в df.
  2. Создай тепловую карту (heatmap) для визуализации этой матрицы, используя библиотеки Matplotlib и Seaborn.
  3. На тепловой карте должны быть отображены числовые значения коэффициентов корреляции.
  4. Используй цветовую схему [выберите цветовую схему, например, “coolwarm”, “viridis”, “YlGnBu”], которая наглядно покажет положительные и отрицательные корреляции.

Формат ответа: Предоставь готовый к выполнению скрипт на Python.

*****

Почему это работает: Промпт не просто просит рассчитать корреляции, а сразу же предлагает наиболее наглядный способ их представления – тепловую карту. Указание библиотек и деталей оформления (значения на карте, цветовая схема) ведет к созданию качественной и информативной визуализации.

9. Поиск аномалий (выбросов)

Проблема: Экстремально высокие или низкие значения могут быть ошибками или важными сигналами. Их нужно найти и проанализировать.

Решение: Промпт предлагает использовать статистический метод для поиска выбросов и вывести строки с этими значениями.

Текст промпта:

*****

Ты – дата-аналитик, ищущий аномалии в данных. Проанализируй pandas DataFrame `df`.

Задача:

  1. Определи выбросы в столбце [укажите числовой столбец, например, “‘Сумма_чека'”] с помощью метода межквартильного размаха (IQR). Выбросами считаются значения, которые выходят за пределы Q1 - 1.5 * IQR и Q3 + 1.5 * IQR.
  2. Напиши код на Python, который определит эти границы.
  3. Выведи на экран количество найденных выбросов (как сверху, так и снизу).
  4. Покажи первые 10 строк датафрейма, которые содержат эти выбросы, для дальнейшего изучения.

Формат ответа: Код на Python с комментариями, объясняющими логику.

*****

Почему это работает: Запрос не просто говорит “найди выбросы”, а указывает на конкретный и широко распространенный метод (IQR). Требование вывести не только количество, но и сами аномальные строки позволяет сразу перейти к их качественному анализу.

10. Сегментация данных по условию

Проблема: Нужно разделить клиентов или другие сущности на группы по определенным критериям (например, “активные” и “неактивные”).

Решение: Промпт помогает создать новый столбец с категориями на основе заданных условий.

Текст промпта:

*****

Ты – Python-программист. Мне нужно сегментировать данные в DataFrame `df`.

Задача: Создай новый столбец с именем [укажите имя нового столбца, например, “‘Сегмент_клиента'”] на основе значений в столбце [укажите исходный столбец, например, “‘Количество_покупок'”].

Правила сегментации:

  • Если значение в столбце ‘Количество_покупок’ > [значение, например, 10], присвоить категорию “Лояльный”.
  • Если значение от [значение, например, 2] до 10, присвоить категорию “Активный”.
  • Если значение меньше 2, присвоить категорию “Новичок”.

Напиши код на Python с использованием pandas для выполнения этой задачи. В конце выведи подсчет количества клиентов в каждом сегменте.

*****

Почему это работает: Промпт четко определяет логические правила для создания сегментов. Это позволяет автоматизировать рутинную задачу по разметке данных и сразу же получить сводку по размерам полученных групп.

11. Группировка данных и агрегация

Проблема: Нужно рассчитать итоговые метрики (сумму, среднее, количество) для разных групп данных.

Решение: Промпт генерирует код для выполнения операции GROUP BY с последующей агрегацией.

Текст промпта:

*****

Ты – эксперт по pandas. Мне нужно сгруппировать данные и рассчитать агрегированные показатели.

Контекст: В DataFrame df есть данные о продажах.

Задача: Напиши код на Python, который:

  1. Группирует данные по столбцу [укажите столбец для группировки, например, “‘Категория_товара'”].
  2. Для каждой группы рассчитывает следующие агрегированные значения:
    • Сумму по столбцу [укажите столбец для суммирования, например, “‘Выручка'”].
    • Среднее значение по столбцу [укажите столбец для среднего, например, “‘Цена'”].
    • Количество уникальных клиентов по столбцу [укажите столбец с ID клиентов, например, “‘ID_клиента'”].
  3. Результат представь в виде нового DataFrame.

Формат ответа: Код на Python с использованием метода .groupby() и .agg().

*****

Почему это работает: Запрос позволяет выполнять сложные агрегации, вычисляя несколько разных метрик за один проход. Это одна из самых частых операций в анализе данных, и автоматизация ее написания экономит массу времени.

12. Формулирование гипотез для A/B-теста

Проблема: Есть данные, но нет идей, что можно улучшить. Нужно сформулировать проверяемые гипотезы для дальнейшего тестирования.

Решение: ИИ, выступая в роли маркетолога, генерирует несколько гипотез на основе предоставленных данных.

Текст промпта:

*****

Ты – опытный маркетолог-аналитик, специалист по продуктовой аналитике. Твоя задача – сгенерировать гипотезы для A/B-тестирования.

Контекст: Мы анализируем данные о поведении пользователей в мобильном приложении. Основная цель – увеличить [укажите целевую метрику, например, “удержание на 7-й день” или “конверсию в покупку”].
Данные содержат следующие метрики: [перечислите ключевые метрики, например, “время сессии”, “количество экранов за сессию”, “использование фичи X”, “частота push-уведомлений”].

Задача:
Сформулируй 3-4 проверяемые гипотезы, направленные на достижение основной цели. Каждая гипотеза должна быть представлена в формате:
“Гипотеза: Если мы [описание изменения], то [ожидаемое изменение метрики], потому что [обоснование/причина].”

Пример: “Гипотеза: Если мы изменим цвет кнопки ‘Купить’ с синего на зеленый, то конверсия в покупку вырастет на 5%, потому что зеленый цвет ассоциируется с действием и безопасностью.”

*****

Почему это работает: Промпт задает строгий и общепринятый формат для формулировки гипотез (“Если… то… потому что…”). Это заставляет ИИ не просто фантазировать, а предлагать осмысленные, логически обоснованные и, главное, проверяемые идеи.

13. Написание SQL-запроса для извлечения данных

Проблема: Нужно получить данные из базы данных, но писать сложный SQL-запрос с соединениями и фильтрами долго и можно ошибиться.

Решение: Промпт переводит описание задачи на естественном языке в готовый SQL-код.

Текст промпта:

*****

Ты – SQL-разработчик. Напиши SQL-запрос для извлечения данных из базы.

Контекст:
У меня есть две таблицы: users (с полями user_id, registration_date, city) и payments (с полями payment_id, user_id, amount, payment_date).

Задача:
Напиши SQL-запрос, который выберет общую сумму платежей (amount) для каждого города (city) за последний месяц ([укажите месяц и год, например, “октябрь 2023 года”]).
Требования к запросу:

  1. Соедини таблицы users и payments по полю user_id.
  2. Отфильтруй платежи, сделанные в указанный период.
  3. Сгруппируй результат по городам.
  4. Отсортируй результат по убыванию общей суммы платежей.
  5. Выведи два столбца: city и total_amount.

Стиль SQL: [укажите диалект, например, “PostgreSQL”, “MySQL”, “T-SQL”].

*****

Почему это работает: Промпт детально описывает структуру таблиц, требуемые операции (соединение, фильтрация, группировка, сортировка) и ожидаемый результат. Это позволяет ИИ сгенерировать сложный и синтаксически верный запрос, который останется только выполнить.

14. Проведение T-теста для сравнения двух групп

Проблема: Нужно статистически значимо определить, есть ли разница в средних значениях метрики между двумя группами (например, в результатах A/B-теста).

Решение: Промпт генерирует код на Python для проведения T-теста и интерпретации его результатов.

Текст промпта:

*****

Ты – статистик-аналитик. Мне нужно сравнить две выборки с помощью T-теста.

Контекст: Я провел A/B-тест. Результаты хранятся в DataFrame df. Есть столбец group (“A” или “B”) и столбец с целевой метрикой metric (например, “время на сайте”).

Задача:

  1. Напиши код на Python, который разделит данные на две выборки (группа А и группа B).
  2. Проведи независимый двухвыборочный T-тест (t-test_ind) из библиотеки SciPy для сравнения средних значений метрики metric в этих двух группах.
  3. Выведи на экран значение t-статистики и p-value.
  4. На основе полученного p-value (с уровнем значимости alpha = 0.05) сделай вывод: являются ли различия между группами статистически значимыми.

Формат ответа: Код и текстовая интерпретация результатов.

*****

Почему это работает: Промпт не только просит написать код, но и требует интерпретировать результат. Это критически важно, так как многие аналитики могут выполнить тест, но не всегда правильно трактуют его итоги (особенно p-value).

15. Расчет хи-квадрат для категориальных переменных

Проблема: Нужно проверить, есть ли связь между двумя категориальными переменными (например, зависит ли выбор тарифа от города клиента).

Решение: Промпт помогает построить таблицу сопряженности и провести на ее основе тест хи-квадрат.

Текст промпта:

*****

Ты – специалист по статистическому анализу. Мне нужно проверить гипотезу о независимости двух категориальных признаков.

Контекст: В DataFrame df есть два столбца: [укажите первый столбец, например, “‘Город'”] и [укажите второй столбец, например, “‘Выбранный_тариф'”].

Задача:

  1. Напиши код на Python, который построит таблицу сопряженности (contingency table) для этих двух столбцов.
  2. Используя эту таблицу, проведи тест хи-квадрат (chi2_contingency) из библиотеки SciPy.
  3. Выведи на экран значение статистики хи-квадрат, p-value и степени свободы.
  4. Интерпретируй p-value (при alpha = 0.05) и сделай вывод о наличии или отсутствии статистически значимой связи между переменными.

*****

Почему это работает: Как и в случае с T-тестом, запрос требует не только механического выполнения расчета, но и понятной для человека интерпретации. Это превращает набор цифр в осмысленный вывод.

16. Генерация синтетических данных

Проблема: Для тестирования скриптов или демонстрации отчета нужны данные, но реальных данных нет или их нельзя использовать из-за конфиденциальности.

Решение: Промпт создает скрипт для генерации искусственного, но правдоподобного датасета с заданными характеристиками.

Текст промпта:

*****

Ты – генератор данных. Твоя задача – создать синтетический датасет.

Задача: Напиши скрипт на Python (используя pandas и numpy), который сгенерирует DataFrame размером [укажите количество строк, например, 1000] строк со следующими столбцами и характеристиками:

  • user_id: уникальный идентификатор от 1 до 1000.
  • age: возраст, случайное целое число от 18 до 65.
  • city: город, случайный выбор из списка [“Москва”, “Санкт-Петербург”, “Новосибирск”, “Екатеринбург”].
  • revenue: выручка, случайное число с нормальным распределением, средним [например, 5000] и стандартным отклонением [например, 1500].
  • registration_date: дата регистрации, случайная дата в пределах [укажите диапазон, например, “последних двух лет”].

Результат: Код на Python, создающий и выводящий первые 5 строк сгенерированного DataFrame.

*****

Почему это работает: Промпт позволяет детально настроить каждый столбец генерируемых данных: задать распределение (нормальное, равномерное), диапазон значений, список категорий. Это помогает создать данные, которые выглядят реалистично для конкретной задачи.

17. Построение гистограммы распределения

Проблема: Нужно визуально оценить, как распределена непрерывная переменная (например, возраст клиентов или сумма чека).

Решение: Промпт генерирует код для построения гистограммы с использованием популярных библиотек.

Текст промпта:

*****

Ты – специалист по визуализации данных. Создай гистограмму.

Задача: Напиши код на Python (используя Matplotlib и/или Seaborn) для построения гистограммы распределения значений в столбце [укажите столбец, например, “‘Цена_товара'”] из DataFrame df.

Требования к визуализации:

  1. Количество бинов (столбцов) на гистограмме: [укажите число, например, 30].
  2. Добавь заголовок к графику: [укажите текст заголовка, например, “Распределение цен на товары”].
  3. Подпиши оси: ось X – [название оси X], ось Y – [название оси Y, например, “Частота”].
  4. Наложи на гистограмму кривую оценки плотности ядра (KDE) для сглаженного представления распределения.

Формат ответа: Готовый к выполнению скрипт на Python.

*****

Почему это работает: Запрос включает все ключевые элементы качественной визуализации: подписи осей, заголовок, количество бинов. Требование добавить KDE-кривую делает график более информативным, показывая форму распределения более гладко.

18. Построение диаграммы рассеяния (Scatter Plot)

Проблема: Нужно визуально оценить взаимосвязь между двумя числовыми переменными.

Решение: Промпт создает код для диаграммы рассеяния, которая наглядно показывает эту связь.

Текст промпта:

*****

Ты – мастер визуализаций в Seaborn. Построй диаграмму рассеяния.

Задача: Напиши код на Python, который создаст диаграмму рассеяния (scatter plot) для анализа взаимосвязи между двумя переменными из DataFrame df.

Требования:

  1. Ось X: столбец [укажите столбец для оси X, например, “‘Опыт_работы_в_годах'”].
  2. Ось Y: столбец [укажите столбец для оси Y, например, “‘Заработная_плата'”].
  3. Добавь третью переменную для окрашивания точек: столбец [укажите категориальный столбец, например, “‘Уровень_образования'”]. Это поможет увидеть паттерны внутри групп.
  4. Задай заголовок и подпиши оси.

Формат ответа: Код на Python с использованием Seaborn.

*****

Почему это работает: Промпт предлагает использовать не две, а три переменные. Окрашивание точек по третьему, категориальному, признаку (hue) – мощный прием, который позволяет обнаружить скрытые зависимости и сегменты в данных, которые не видны на простом двумерном графике.

19. Создание столбчатой диаграммы (Bar Chart)

Проблема: Нужно сравнить метрики между несколькими категориями (например, продажи по разным городам).

Решение: Промпт генерирует код для построения столбчатой диаграммы, идеально подходящей для таких сравнений.

Текст промпта:

*****

Ты – специалист по созданию отчетов. Мне нужна столбчатая диаграмма.

Контекст: У меня есть агрегированные данные в DataFrame aggregated_df, где в качестве индекса – [укажите, что в индексе, например, “названия городов”], а в столбце [укажите столбец, например, “‘total_sales'”] – итоговые значения.

Задача: Напиши код на Python для построения столбчатой диаграммы (bar chart), который:

  1. Отобразит категории (города) по оси X, а значения (продажи) – по оси Y.
  2. Отсортирует столбцы по убыванию высоты для лучшего восприятия.
  3. Добавит заголовок и подписи осей.
  4. Используй библиотеку [укажите библиотеку, например, “Seaborn” или “Matplotlib”].

Формат ответа: Готовый код на Python.

*****

Почему это работает: Требование отсортировать столбцы по убыванию – это не мелочь, а ключевой элемент хорошей практики визуализации. Отсортированная диаграмма читается и интерпретируется в разы легче, чем хаотичная.

20. Построение ящика с усами (Box Plot)

Проблема: Нужно сравнить распределение числовой переменной сразу по нескольким категориям и одновременно выявить выбросы.

Решение: Промпт создает код для построения графика “ящик с усами”, который отлично справляется с этой задачей.

Текст промпта:

*****

Ты – аналитик, эксперт по статистическим визуализациям. Построй “ящик с усами”.

Задача: Напиши код на Python (используя Seaborn) для создания графика “ящик с усами” (box plot).

Требования:

  1. Сравни распределение числовой переменной [укажите числовую переменную, например, “‘Длительность_сессии'”]…
  2. …по разным группам, определенным в категориальном столбце [укажите категориальный столбец, например, “‘Тип_устройства’ (ПК, мобайл)”].
  3. Ось X – категории, ось Y – числовая переменная.
  4. Добавь заголовок “Сравнение длительности сессии по типам устройств” и подпиши оси.

Формат ответа: Код на Python.

*****

Почему это работает: “Ящик с усами” – очень емкая визуализация. Она одновременно показывает медиану, квартили, разброс данных и выбросы для каждой группы. Промпт направляет ИИ на создание именно такого комплексного сравнительного графика.

21. Линейный график для временных рядов

Проблема: Нужно отследить динамику изменения метрики во времени.

Решение: Промпт помогает построить линейный график, который является стандартом для визуализации временных рядов.

Текст промпта:

*****

Ты – специалист по анализу временных рядов. Создай линейный график.

Контекст: У меня есть DataFrame time_series_df с данными о [опишите данные, например, “ежедневном количестве посетителей сайта”]. В нем есть столбец с датой date и столбец со значением visitors.

Задача: Напиши код на Python для построения линейного графика (line plot), который:

  1. Отобразит по оси X даты (столбец date).
  2. Отобразит по оси Y значения (столбец visitors).
  3. Установит размер графика для лучшей читаемости (например, 15 на 6 дюймов).
  4. Добавит заголовок “Динамика посещаемости сайта” и подпишет оси.

Формат ответа: Код на Python с использованием Matplotlib или Seaborn.

*****

Почему это работает: Промпт четко указывает, какой столбец отвечает за время, а какой – за значение. Упоминание размера графика – важная деталь, так как графики временных рядов часто требуют большей ширины для наглядного отображения динамики.

22. Подготовка данных для модели машинного обучения

Проблема: Перед обучением модели данные нужно преобразовать: категориальные признаки перевести в числа, а числовые – отмасштабировать.

Решение: Промпт генерирует код для выполнения стандартных шагов предобработки данных с помощью Scikit-learn.

Текст промпта:

*****

Ты – дата-сайентист, готовящий данные для обучения модели.

Контекст: У меня есть DataFrame df, который нужно подготовить для модели классификации. Целевая переменная – столбец target.

Задача: Напиши код на Python, который выполнит следующие шаги предобработки:

  1. Разделит данные на матрицу признаков X и вектор целевой переменной y.
  2. Определит список числовых и категориальных признаков.
  3. Для категориальных признаков применит OneHotEncoder (преобразование в фиктивные переменные).
  4. Для числовых признаков применит StandardScaler (стандартизация).
  5. Объединит эти шаги с помощью ColumnTransformer.
  6. Разделит итоговые данные на обучающую и тестовую выборки в соотношении [укажите соотношение, например, “80/20”].

Формат ответа: Полный скрипт на Python с использованием Scikit-learn.

*****

Почему это работает: Промпт описывает полный и правильный конвейер (pipeline) предобработки данных. Использование `ColumnTransformer` – это лучшая практика, позволяющая избежать утечки данных и корректно применять разные преобразования к разным типам столбцов.

23. Обучение простой модели классификации

Проблема: Нужно быстро обучить базовую модель, чтобы получить первую оценку качества (baseline) для задачи классификации.

Решение: Промпт генерирует код для обучения модели логистической регрессии и оценки ее качества.

Текст промпта:

*****

Ты – специалист по машинному обучению. Обучи базовую модель классификации.

Контекст: Данные уже разделены на обучающую (X_train, y_train) и тестовую (X_test, y_test) выборки.

Задача:

  1. Напиши код на Python для обучения модели LogisticRegression из библиотеки Scikit-learn.
  2. Обучи модель на обучающей выборке (X_train, y_train).
  3. Сделай предсказания на тестовой выборке (X_test).
  4. Рассчитай и выведи на экран следующие метрики качества: ‘accuracy’ (точность), ‘precision’ (точность), ‘recall’ (полнота) и ‘f1-score’.
  5. Построй и покажи матрицу ошибок (confusion matrix).

Формат ответа: Код на Python и вывод метрик.

*****

Почему это работает: Промпт запрашивает не просто обучение модели, а полный цикл оценки ее качества. Требование рассчитать несколько метрик (а не только accuracy) и построить матрицу ошибок дает комплексное понимание того, как работает модель и где она ошибается.

24. Обучение простой модели регрессии

Проблема: Нужно предсказать числовое значение (например, цену или доход) и нужна базовая модель для оценки.

Решение: Промпт генерирует код для обучения модели линейной регрессии и оценки ее точности.

Текст промпта:

*****

Ты – специалист по машинному обучению. Обучи базовую модель регрессии.

Контекст: Данные разделены на обучающую (X_train, y_train) и тестовую (X_test, y_test) выборки. Задача – предсказать непрерывную переменную.

Задача:

  1. Напиши код на Python для обучения модели LinearRegression из Scikit-learn.
  2. Обучи модель на обучающих данных.
  3. Сделай предсказания на тестовых данных.
  4. Рассчитай и выведи на экран метрики качества для регрессии: Средняя абсолютная ошибка (MAE), Среднеквадратичная ошибка (MSE) и Коэффициент детерминации (R-квадрат).

Формат ответа: Код на Python и вывод метрик.

*****

Почему это работает: Запрос требует расчета трех стандартных метрик для задач регрессии (MAE, MSE, R²). Каждая из них показывает качество модели с разных сторон, что дает более полное представление о ее точности, чем любая одна метрика.

25. Поиск оптимальных гиперпараметров модели

Проблема: Качество модели сильно зависит от ее настроек (гиперпараметров). Подбирать их вручную долго и неэффективно.

Решение: Промпт помогает написать код для автоматического подбора гиперпараметров с помощью `GridSearchCV`.

Текст промпта:

*****

Ты – дата-сайентист. Помоги мне настроить модель.

Контекст: Я хочу улучшить качество модели [укажите модель, например, “Случайный лес (RandomForestClassifier)”] путем подбора гиперпараметров.

Задача:

  1. Напиши код на Python, который использует GridSearchCV из Scikit-learn для поиска наилучшей комбинации гиперпараметров.
  2. Задай сетку параметров для поиска. Например, для RandomForestClassifier это могут быть:
    'n_estimators': [100, 200, 300]
    'max_depth': [10, 20, None]
    'min_samples_leaf': [1, 2, 4]
  3. Используй кросс-валидацию на [укажите количество фолдов, например, 5] фолдах.
  4. В качестве метрики для оптимизации используй [укажите метрику, например, “‘f1_score'”].
  5. После завершения поиска выведи на экран наилучшие найденные параметры и соответствующее им значение метрики.

*****

Почему это работает: Промпт описывает стандартный и надежный метод для тюнинга моделей. Он четко определяет модель, сетку поиска, метрику оптимизации и метод валидации, что позволяет ИИ сгенерировать полный и корректный код для этой сложной задачи.

26. Написание выводов по результатам анализа

Проблема: Анализ проведен, графики построены, но нужно сформулировать краткие и понятные выводы для нетехнических специалистов.

Решение: Промпт помогает ИИ структурировать результаты и представить их в виде выводов на деловом языке.

Текст промпта:

*****

Ты – бизнес-аналитик, который готовит отчет для руководства. Твоя задача – написать выводы по результатам анализа данных.

Контекст: Был проведен анализ продаж за последний квартал. Основные находки:
[Кратко перечислите основные находки в виде фактов. Например:

  • “Продажи в категории ‘Электроника’ выросли на 25% по сравнению с прошлым кварталом.”
  • “Самым прибыльным городом является Москва, но в Санкт-Петербурге самый высокий средний чек.”
  • “Выявлена отрицательная корреляция (-0.6) между количеством скидочных товаров в чеке и общей суммой чека.”
  • “A/B-тест показал, что новая версия страницы оформления заказа увеличивает конверсию на 12% (p-value < 0.05)."]

Задача:
На основе этих фактов напиши 3-4 ключевых вывода для отчета. Каждый вывод должен быть кратким, ясным и ориентированным на бизнес-результат. Избегай технического жаргона (p-value, корреляция).

Стиль: Деловой, лаконичный.
Целевая аудитория: Руководители, не имеющие технической подготовки.

*****

Почему это работает: Промпт четко разделяет факты (входные данные) и выводы (ожидаемый результат). Указание целевой аудитории и стиля заставляет ИИ “перевести” технические результаты на язык бизнеса, что является критически важным навыком для любого аналитика.

27. Объяснение сложного термина простыми словами

Проблема: В анализе данных много сложных концепций (p-value, R-квадрат, градиентный бустинг), которые трудно объяснить коллегам или заказчикам.

Решение: Промпт просит ИИ объяснить сложный термин с помощью простой аналогии.

Текст промпта:

*****

Ты – популяризатор науки, который умеет объяснять сложные вещи просто.

Задача: Объясни концепцию [укажите сложный термин, например, “p-value в статистике”] простыми словами, как если бы ты объяснял это 12-летнему подростку.

Требования:

  1. Используй простую и понятную аналогию из реальной жизни.
  2. Избегай любых технических терминов и формул.
  3. Объяснение должно быть не длиннее 100-150 слов.
  4. В конце дай один пример, когда это понятие важно.

Пример для аналогии: для p-value можно использовать аналогию с судом и презумпцией невиновности.

*****

Почему это работает: Требование использовать аналогию и ограничение на объем заставляют ИИ найти самую суть концепции и изложить ее максимально доступно. Это мощный инструмент для улучшения коммуникации внутри команды и с заказчиками.

28. Создание плана аналитического проекта

Проблема: Перед началом большого исследования нужно составить план, чтобы ничего не упустить и двигаться последовательно.

Решение: Промпт помогает сгенерировать структурированный план аналитического проекта от начала до конца.

Текст промпта:

*****

Ты – руководитель аналитического отдела. Создай пошаговый план для нового проекта.

Контекст:

  • Бизнес-задача: [опишите задачу, например, “Проанализировать причины оттока клиентов за последние 6 месяцев и предложить меры по его снижению”].
  • Имеющиеся данные: [опишите данные, например, “база данных с профилями клиентов, история их покупок и обращений в поддержку”].

Задача:
Составь детализированный план аналитического проекта, включающий следующие этапы:

  1. Определение метрик (что конкретно будем измерять).
  2. Сбор и подготовка данных (что нужно выгрузить, как очистить).
  3. Разведочный анализ (EDA) (какие гипотезы проверить, какие срезы посмотреть).
  4. Моделирование (если применимо, какую модель можно построить).
  5. Формулирование выводов и рекомендаций.
  6. Подготовка отчета/презентации.

Для каждого этапа кратко опиши ключевые действия.

Формат ответа: Нумерованный список с подпунктами.

*****

Почему это работает: Промпт заставляет ИИ мыслить структурно и пройтись по всем классическим этапам CRISP-DM (стандартной методологии анализа данных). Это гарантирует, что в плане будут учтены все важные шаги, от постановки задачи до презентации результатов.

Команды для уточнения запросов в анализе данных

Иногда базового запроса недостаточно. Чтобы получить от нейросети именно то, что нужно, можно использовать специальные команды-модификаторы. Они помогают управлять форматом, стилем и глубиной ответа.

Команда/Модификатор Назначение Пример использования в промпте
ДЕЙСТВУЙ ШАГ ЗА ШАГОМ Заставляет ИИ подробно расписывать свою логику, что полезно для сложных задач и отладки. …Напиши SQL-запрос для объединения трех таблиц. Действуй шаг за шагом: сначала объясни, как соединить первые две, а затем как добавить третью.
В ФОРМАТЕ [X] Четко задает формат вывода: таблица, JSON, XML, маркированный список и т.д. …Сгенерируй 5 гипотез для увеличения среднего чека. Ответ дай в формате JSON с ключами “hypothesis” и “reason”.
ИСКЛЮЧИ [X] Помогает избавиться от ненужной информации или подходов в ответе. …Предложи способы визуализации данных о продажах. Исключи круговые диаграммы.
ПРЕДСТАВЬ КАК ЭКСПЕРТ В [X] Повышает качество ответа, заставляя ИИ имитировать стиль и знания узкого специалиста. Представь как эксперт в эконометрике. Объясни разницу между корреляцией и причинно-следственной связью на примере данных о продажах мороженого.
СРАВНИ [X] И [Y] Позволяет получить детальное сравнение двух подходов, моделей или метрик. …Сравни модели градиентного бустинга и случайного леса для задачи классификации. Укажи их плюсы, минусы и типичные сценарии использования. Ответ представь в виде таблицы.
ОГРАНИЧЬ ОТВЕТ [X] СЛОВАМИ Полезно, когда нужна краткая выжимка, а не длинное эссе. …Напиши ключевые выводы по итогам A/B-теста. Ограничь ответ 50 словами.

Неочевидные советы для продвинутой работы

Когда вы освоите базовые приемы, можно переходить на следующий уровень. Эти советы помогут вам использовать нейросети не просто как исполнителя, а как полноценного партнера в аналитической работе.

  1. Используйте ИИ для генерации документации к вашему коду. После того как вы написали сложный скрипт для обработки данных или построения модели, попросите нейросеть “написать docstrings и комментарии” к вашему коду. Это сэкономит массу времени и сделает вашу работу понятнее для коллег и для вас самих в будущем.
  2. Просите нейросеть выступить в роли “критика” ваших выводов. Сформулируйте свои выводы по анализу и попросите ИИ: “Ты – скептически настроенный оппонент. Найди слабые места в моей аргументации. Какие вопросы ты бы задал? Что я мог упустить?”. Это отличный способ проверить свои гипотезы на прочность перед презентацией.
  3. Сохраняйте удачные цепочки диалогов, а не только отдельные промпты. Часто лучший результат получается не с первого раза, а после 2-3 уточнений. Сохраняйте всю последовательность “запрос-ответ-уточнение”, чтобы в будущем можно было воспроизвести не только команду, но и весь ход мысли.
  4. Используйте ИИ для перевода аналитических результатов на язык разных аудиторий. Дайте нейросети один и тот же набор выводов и попросите: “Объясни это для маркетолога”, а затем “Объясни это для финансового директора”. Вы получите разные акценты и формулировки, адаптированные под конкретного слушателя.
  5. Попросите ИИ объяснить результаты работы сложного алгоритма. Например, после обучения модели градиентного бустинга можно спросить: “Объясни на простом примере, какие два-три фактора оказались самыми важными для предсказания оттока и как они влияют на результат”. Это помогает в интерпретации моделей “черного ящика”.
  6. Генерируйте регулярные выражения с помощью ИИ. Работа с текстовыми данными часто требует использования “регулярок”, синтаксис которых многие забывают. Просто опишите словами, что вы хотите найти или извлечь из строки, и попросите написать для этого регулярное выражение. Например: “Напиши регулярное выражение для извлечения всех email-адресов из текста”.