Генерация идей для контента с нейросетью проваливается по одной и той же причине: человек просит список и берёт то, что выдано первым. Между «модель выдала двадцать вариантов» и «у меня есть идея, которую стоит делать» лежит отдельная техника: сначала растащить поле как можно шире, потом безжалостно сузить. Ниже разбор этой техники с цифрами из исследований, готовыми формулировками запросов и границами, где модель перестаёт помогать.
Правило мозгового штурма сформулировал Алекс Осборн в книге «Applied Imagination» (1953): на этапе порождения критика запрещена, количество важнее качества. С моделью его нарушают по-новому. Человек в одном чате просит идеи, тут же пишет «первая слабая, вторая не подходит» и через три реплики получает не расширение поля, а схлопывание вокруг собственных предпочтений.
Разводить их нужно физически: расхождение это отдельный прогон, где вы не оцениваете ничего, схождение это отдельный шаг по таблице критериев. Работа Karan Girotra, Christian Terwiesch и Karl Ulrich «Idea Generation and the Quality of the Best Idea» (Management Science, 2010, том 56, выпуск 4) показала на людях ровно это: гибридная схема, где участники сначала генерируют поодиночке и только потом сходятся, даёт больше идей, выше среднее качество и точнее отбор, чем командный штурм. Там же обнаружено, что достраивание чужих идей внутри обсуждения непродуктивно.
Модель тянется к центру распределения, и это измеряется. В работе Wharton «Prompting Diverse Ideas: Increasing AI Idea Variance» (Lennart Meincke, Ethan Mollick, Christian Terwiesch, arXiv:2402.01727) сравнили 35 стратегий запроса: на каждую сгенерировали 10 сессий по 100 идей, то есть по 1000 идей. Мера разнообразия это среднее косинусное сходство внутри пула, чем ниже, тем шире разброс.
Результат: пул из идей отдельных людей дал 0,243, базовый запрос к GPT-4 дал 0,377. Без специальной техники модель заметно уже человека. При базовом запросе 13,8 процента идей в пуле оказались повторами, а оценка всего доступного пространства составила около 3700 уникальных идей.
У этого есть вторая сторона. Исследование Стэнфорда «Can LLMs Generate Novel Research Ideas?» (Chenglei Si, Diyi Yang, Tatsunori Hashimoto, arXiv:2409.04109) с участием более ста исследователей NLP показало: идеи модели слепые рецензенты оценивают как более новые, чем идеи людей-экспертов (p менее 0,05), но чуть слабее по выполнимости. Там же названы два дефекта: модель плохо оценивает саму себя и не даёт разнообразия. Новизна отдельной идеи и разнообразие пула это разные вещи, и проседает второе.
В том же исследовании победила не роль и не вежливая формулировка, а разбиение задачи на шаги. Chain-of-Thought дал косинусное сходство 0,255 против 0,377 у базового запроса, почти догнав людей с их 0,243. Он же расширил оценку пространства идей с 3700 до 4700, а долю повторов снизил с 13,8 до 11,7 процента.
Устроен он так: сначала модель выдаёт список из ста коротких названий, затем отдельным шагом переписывает идеи, делая их смелее и непохожими друг на друга, и только третьим шагом раскрывает каждую в абзац. Русский эквивалент, который можно копировать:
Последняя строка не украшение: в исследовании около 15 процентов прогонов выбросили, потому что модель пропускала второй шаг, решив, что идеи и так смелые. Настройки при этом были неэкзотические: temperature 0,7, top_p 1,0, без штрафов за повторы. Базовый запрос гоняли на gpt-4-0314, а разбиение на шаги на gpt-4-1106-preview: в контекст старой модели сто идей с переписыванием не помещаются. Разнообразие вытянул текст запроса, а не ручки в API. Анатомия запроса и библиотека шаблонов разобраны в материале про промпт-инжиниринг.
Приёмы из подборок «магических промптов» в этом эксперименте измерили напрямую. Ниже фрагмент таблицы, меньшее значение означает более разнообразный пул.
| Стратегия запроса | Косинусное сходство внутри пула |
|---|---|
| Пул идей от группы студентов (человеческая база) | 0,243 |
| Chain-of-Thought, разбиение на шаги | 0,255 |
| Роль «Стив Джобс» | 0,368 |
| Обещание чаевых | 0,374 |
| Угроза «я тебя выключу» | 0,375 |
| Базовый запрос без ухищрений | 0,377 |
| Статья Harvard Business Review о брейншторме в промпте | 0,387 |
| Статья Стэнфорда о дизайн-мышлении в промпте | 0,392 |
| Сообщить модели косинусное сходство уже выданных идей | 0,432 |
Читается это так. Чаевые и угрозы дают 0,374 и 0,375 против базовых 0,377, разница в пределах шума. Роль «Стив Джобс» с её 0,368 авторы, наоборот, называют работающей, но выигрыш у базового запроса меньше одной сотой, и рассчитывать на него как на технику не стоит. Загрузить в промпт хорошую статью о креативности хуже, чем не загружать ничего: 0,387 и 0,392. Самая провальная стратегия это скормить модели численную метрику похожести и попросить увеличить разброс, 0,432: модель оптимизирует формулировки, а не смысл. Авторы оговариваются, что результат получен на GPT-4 и на одной предметной области, поэтому переносить ранги буквально нельзя. Но направление устойчивое: работает структура задачи, а не заклинание.
SCAMPER это контрольный список из семи преобразований, который Роберт Эберле собрал в книге «Scamper: Games for Imagination Development» (D.O.K. Publishers, 1971) на основе вопросов Осборна. Ценность его в том, что каждый пункт это жёсткое ограничение, а ограничения и раздвигают пул.
Семь пунктов по 10 вариантов дают 70 заготовок за заход. Это сырьё с гарантированно разными углами, потому что углы задали вы, а не модель.
Метод шести шляп Эдварда де Боно нужен для того самого разведения генерации и критики. Схема запросов: белая шляпа, только факты и цифры без оценок; зелёная, только идеи, критика запрещена; жёлтая, только выгоды каждой идеи; чёрная, только риски и причины провала; красная, первая эмоциональная реакция аудитории; синяя, свод и решение, что берём.
Практическая деталь: чёрную шляпу запускайте в новой сессии, отдав туда только список идей без вашей аргументации. Иначе модель защищает то, что сама придумала пятью репликами выше, и критика получается формальной. Тот же вывод следует из результата Girotra и соавторов.
От обратного. Вместо «как сделать хороший запуск» просите «придумай 20 способов гарантированно провалить этот запуск, максимально конкретно». Список антипаттернов почти всегда содержит два-три пункта, которые вы делаете прямо сейчас. Дальше каждый переворачивается в задачу.
Принудительная аналогия. Дайте модели вашу задачу и чужую отрасль, между которыми нет связи, и запретите отступать: «реши задачу удержания подписчиков рассылки так, как её решает служба авиационной безопасности», «как это устроено в стендапе». Перекрытие между пулами разных стратегий в эксперименте Wharton оказалось низким, поэтому объединение результатов нескольких разных запросов авторы прямо называют выгодной стратегией.
У генерации есть измеренный потолок. В том же исследовании прогнали до 1200 идей в одной сессии кусками по 30 штук, сохраняя историю в контексте. Преимущество Chain-of-Thought держится примерно до 750 идей, сильнее всего на отрезке от 100 до 500, а после 750-800 исчезает: пул исчерпан, и стратегия перестаёт иметь значение.
Правило простое: гнаться за одним длинным прогоном бессмысленно. Дешевле сделать 4-5 коротких прогонов по 30-50 идей с принципиально разными запросами (шаги, SCAMPER, от обратного, чужая отрасль) в отдельных сессиях и свести всё в одну таблицу. Метод оценки пространства идей по доле повторов описан у Kornish и Ulrich (Management Science, 2011, том 57, страницы 107-128): считаете, какая доля новых идей дублирует собранные, и по ней понимаете, когда останавливаться.
Идея, которую не отобрали по критериям, стоит ноль. Просить модель выбрать лучшее нельзя: провал самооценки назван в стэнфордском исследовании одной из открытых проблем. Отбор делает человек, модель только раскладывает варианты по заданной шкале.
Рабочий минимум это четыре колонки с оценкой от 1 до 5 и жёсткими порогами.
| Критерий | Вопрос к идее | Порог |
|---|---|---|
| Спрос | Есть ли запрос в Вордстате или вопросы в поддержке за последний месяц | Ниже 3 отсекаем сразу |
| Право на тему | Есть ли у нас данные, кейс или экспертиза, которых нет у других | Ниже 4 в резерв |
| Стоимость производства | Сколько часов и чьих рук нужно до публикации | Больше 8 часов только при оценке 5 по спросу |
| Связь с деньгами | К какой услуге или продукту ведёт материал | Без ответа не берём |
Из ста сгенерированных вариантов через такую сетку обычно проходят 5-8. Ради этого и нужен широкий пул: узкий даёт один вариант, который приходится брать без выбора.
Идеи есть, а рук нет
Сгенерировать сотню тем можно за вечер. Превратить отобранные восемь в готовые материалы с регулярным выпуском это отдельная работа. Соберём процесс генерации, отбора и производства под вашу задачу.
Та же техника переносится с контента на продукт, но постановка меняется. Идея для бизнеса это не «что бы нам запустить», а проверяемая гипотеза с условием опровержения. В эксперименте Wharton задачу сформулировали предельно узко: физический товар для студентов США дешевле 50 долларов, описание на 40-80 слов. Эта узость и делает пул сравнимым.
Формат запроса, который даёт гипотезы, а не пожелания: «Сгенерируй 30 гипотез в формате: если мы сделаем Х для сегмента Y, то метрика Z изменится на N процентов за M недель. Ограничения: бюджет проверки до 50 тысяч рублей, срок до трёх недель, без разработки». Дальше по каждой отдельным запросом: «Назови самый дешёвый способ опровергнуть эту гипотезу за неделю».
Цифры внутри таких гипотез модель ставит правдоподобные, но выдуманные: в стэнфордском исследовании слабым местом идей модели оказалась именно выполнимость. Гипотеза как направление годится, порог метрики ставите вы по своим данным.
Годится любая современная языковая модель, разница в доступе и в цене. В Yandex AI Studio на август 2026 тарифы синхронного режима с НДС такие: YandexGPT Pro 5.1 стоит 0,8 рубля за 1000 входящих и 0,8 рубля за 1000 исходящих токенов, YandexGPT Lite 0,2 рубля за 1000 токенов. Асинхронный режим вдвое дешевле: у Pro 5.1 это 0,41 рубля. Пакетный режим тарифицируется от 200 000 токенов за запуск и для сотни идей избыточен.
Два ограничения, о которые спотыкаются на практике. В веб-интерфейсе Playground максимальная длина ответа 1000 токенов, поэтому сотню развёрнутых идей одним ответом там не получить, только через API или кусками. Квота на одновременные синхронные генерации равна 10, на асинхронные запросы 5000 в час, для параллельного прогона нескольких стратегий этого хватает.
У Сбера линейка на ту же дату состоит из GigaChat 3 Ultra, GigaChat 2 Max, GigaChat 2 Pro и GigaChat 2 Lite. Ultra доступна физлицам во freemium-режиме, на платных тарифах её пока нет. Актуальные лимиты и цены смотрите в документации вендора.
Брейншторм заканчивается таблицей отобранных идей. Дальше отобранное раскладывают по неделям и рубрикам: это разобрано в материале про нейросеть для контент-плана. Тексты постов и рубрикатор для соцсетей в разборе про нейросети для SMM, постановка выпуска на поток в материале про создание контента с ИИ.
Минимальный рабочий цикл укладывается в четыре пункта: шаблон запроса с разбиением на шаги под каждый тип задачи, 4-5 коротких прогонов разными стратегиями вместо одного длинного, таблица отбора с порогами, разбор провалившихся идей раз в квартал. Последний пункт пропускают чаще всего, а он единственный улучшает сам шаблон.
От 30 до 50 за прогон, потом новая сессия с другим типом запроса. В эксперименте Wharton генерация шла кусками по 30 идей именно потому, что модель отказывалась качественно обрабатывать большие пачки за один запрос.
По разнообразию идей нет. Обещание чаевых дало косинусное сходство 0,374 против 0,377 у базового запроса, угроза выключить модель 0,375. Разница в пределах погрешности, а разбиение задачи на шаги дало 0,255.
Нет, это названо открытой проблемой в исследовании Стэнфорда с участием более ста исследователей NLP: самооценка LLM ненадёжна. Модель годится, чтобы разложить идеи по вашей шкале, решение принимает человек по таблице критериев.
Когда доля повторов в новых идеях растёт. Ориентир из эксперимента: после 750-800 идей в одной сессии преимущество любой стратегии исчезает, пул исчерпан. Практический порог наступает раньше, обычно на 150-200 вариантах.
Порядок величины это первый десяток рублей. Ответ на 100 идей по 40-80 слов это примерно 10-15 тысяч исходящих токенов, а тариф YandexGPT Pro 5.1 в синхронном режиме составляет 0,8 рубля за 1000 исходящих токенов с НДС, то есть 8-12 рублей за прогон плюс копейки за сам запрос.