Нейросеть для генерации текста на русском: Порфирьевич и что пришло ему на смену

Все статьи
Все статьи
Редакция Neurounit
13 декабря 2025
Обновлено 22 августа 2026
Нейросети
Нейросеть для генерации текста на русском: Порфирьевич и что пришло ему на смену
Порфирьевич это российская нейросеть для генерации осмысленных текстов на русском языке, созданная программистом Михаилом Гранкиным как аналог GPT-2 от OpenAI. Модель обучена на произведениях Достоевского, Толстого, Пушкина и других классиков. Разбираем историю создания и принцип работы сервиса.

Порфирьевич это нейросеть для генерации текста на русском, которая в 2019 году стала известна далеко за пределами профессиональной среды. Сервис работает до сих пор: мы проверили сайт и API 21 августа 2026 года, эндпоинт здоровья отвечает, генерация идёт. Ниже разбор того, как он устроен, что делает, где перестаёт справляться и чем закрывают те же задачи в 2026 году.

Что такое Порфирьевич за минуту

Порфирьевич это веб-сервис, который дописывает начатый вами текст на русском языке. Автор проекта Михаил Гранкин, разработка велась в открытом репозитории github.com/mgrankin/ru_transformers, созданном 23 сентября 2019 года. На момент проверки у репозитория 764 звезды и 96 форков, лицензия Apache 2.0.

Ключевые факты:

  • Архитектура: GPT-2, обученная с нуля на русском корпусе, а не перевод чужой модели.
  • Данные дообучения: русская классика и проза. В README перечислены датасеты по Достоевскому, Толстому, Пушкину, Булгакову, Гоголю и Пелевину.
  • Имя: отсылка к роботу Порфирию Петровичу из романа Виктора Пелевина «iPhuck 10». Эту версию приводили публикации конца 2019 года, включая «Мир фантастики».
  • Доступ: сайт porfirevich.ru и два Telegram-бота из README проекта: @PorfBot для прозы и @NeuroPoetBot для стихов, обе ссылки открываются.
  • Цена: ноль. Регистрация нужна только для публикации истории в общую галерею.

Важно снять частое заблуждение: это не чат-бот. Порфирьевич не отвечает на вопросы и не выполняет задания, он продолжает поданный фрагмент. Это принципиально другой режим работы.

Как он устроен технически

Схема обучения описана в README репозитория. Сначала модель GPT-2 училась русскому языку на корпусе объёмом 230 ГБ, затем дообучалась на 500 МБ русской классической литературы с постепенной разморозкой слоёв (параметр unfreeze_level по последовательности 0, 1, 2, 7, -1). В качестве валидационного набора автор использовал переписку Льва Толстого с молодым Махатмой Ганди.

Размеры и качество из таблиц README:

Сборка Параметров Перплексия на классике Перплексия на большом корпусе
Small 124 млн 26,22 (28 эпох) 30,5 — 30,9
Medium 355 млн 20,97 (7 эпох) 23,8 — 24,15

Чем ниже перплексия, тем лучше модель предсказывает следующий токен. Значение 20,97 у Medium получено на маленьком классическом датасете, и автор прямо предупреждает: на 500 МБ модель переобучается за 3 — 7 эпох. Красивая цифра тут скорее про подгонку под узкий корпус, чем про универсальное качество.

Остальные технические детали, которые стоит знать:

  • Токенизатор YTTM со словарём на 50 257 токенов, автор перешёл на него с SentencePiece: файлы на 10 процентов меньше и быстрее.
  • Контекстное окно архитектуры GPT-2 составляет 1024 токена. Это потолок, дальше модель просто не видит начало вашего текста.
  • Веса выложены в публичный S3 и скачиваются без регистрации: aws s3 sync —no-sign-request s3://models.dobro.ai/gpt2/ru all. Папки с префиксом s_ это Small, m_ это Medium.
  • В README сказано, что на сайте крутится модель из папки Pelevin, а не «чистая» классическая.
  • Репозиторий заархивирован, последний коммит датирован 7 декабря 2020 года. Код проекта не развивается уже шестой год.

Что показывает API сегодня

Сайт общается с бэкендом api.porfirevich.com. OpenAPI-схема открыта и называется «Russian GPT», версия 0.3. Параметры сняты 21 августа 2026 года:

  • Метод POST /generate/ принимает поля prompt, model, length, num_samples, temperature, allow_linebreak.
  • length это число генерируемых токенов: минимум 1, максимум 150, по умолчанию 15.
  • num_samples: от 1 до 5 вариантов за запрос, по умолчанию 3.
  • temperature: от 0,1 до 10, по умолчанию 1,1. В интерфейсе этот ползунок подписан «Креативность (шиз)».
  • Метод GET /models отдаёт пять моделей: lawa, mig, original, gpt3, frida. Модель по умолчанию в схеме указана как gpt3.

Отсюда вывод, которого нет в большинстве обзоров: называть Порфирьевича «нейросетью GPT-2» сегодня уже неточно. GPT-2 это только вариант original, по умолчанию сервис отдаёт запрос модели поколения GPT-3, а рядом лежат ещё три сборки, которые фронтенд подтягивает списком динамически. Публичного описания того, что стоит за lawa и mig, автор не оставил.

Что он умеет и чего не умеет

Интерфейс минимальный: поле с подсказкой «Придумайте начало истории», кнопка «Дополнить», блок «Варианты» с тремя продолжениями, селектор «Модель» и ползунок «Объем генерируемого текста (токенов)». Нажали ещё раз, получили другие три варианта: при температуре 1,1 повторов практически не бывает.

Хорошо получается три вещи: продолжение художественного абзаца в узнаваемой книжной интонации с верным согласованием и ритмом, стихотворные наброски через @NeuroPoetBot (рифма выходит через раз, но заготовка для правки годится) и абсурдные комические тексты, ради которых сервис в основном и открывают.

Что не получается. Мы прогнали через API запрос «Напиши список из пяти преимуществ электромобиля.» на трёх моделях, по два варианта на каждую. Списка не выдала ни одна: original ушла в рассуждение про «New York Times», gpt3 ответила фразой «Самый простой, можно просто переключаться», frida начала сочинять школьный урок. Инструкция прочитана как начало художественного текста, а не как задание: instruction-tuning в модели нет.

Отсюда список ограничений, который стоит запомнить:

  1. Не выполняет инструкции. Нет ни системного промпта, ни роли, ни формата ответа.
  2. Не держит длинный текст. Окно 1024 токена и потолок 150 токенов за нажатие означают, что статью придётся собирать десятками итераций, теряя связность.
  3. Не проверяет факты. Модель 2019 — 2020 годов без доступа к поиску выдумывает имена, даты и цитаты.
  4. Не подходит для карточек товара и рассылок. Тон уводит в художественную прозу, бренд-требования учесть нечем.
  5. Не фильтрует стилистику. Пелевин в дообучении даёт узнаваемый и не всегда уместный для делового текста результат.

Порфирьевич сегодня: зачем он всё ещё нужен

Сервис не заброшен. В открытой галерее историй лежат свежие публикации: самая новая на момент проверки датирована 15 августа 2026 года, у записей считаются просмотры и лайки. Внутри история хранится размеченными кусками: фрагмент помечен нулём, если его написал человек, и единицей, если модель. Поддержка проекта идёт через Boosty и Patreon.

Живых сценариев осталось три.

  • Литературный эксперимент. Соавторство, где ценность именно в непредсказуемости. Современная выровненная модель такого не даст, она слишком аккуратна.
  • Генерация абсурда для контента. Мемы, посты, подводки, шутки, тексты для видео. Ползунок «шиз» до 10 это готовый инструмент под задачу.
  • Учебный пример. Репозиторий под Apache 2.0, два Colab-ноутбука для дообучения и корпуса, веса в открытом S3. Это один из немногих полностью прозрачных примеров того, как GPT-2 учат новому языку.

Вывод редакции: Порфирьевич это музейный экспонат, который продолжает работать. В производственный процесс 2026 года его ставить нельзя, держать в закладках ради развлечения и обучения смысл есть. Заслуга проекта в другом: он показал русскоязычной аудитории, что генерация текста это не фантастика, ещё до того, как на рынке появились массовые инструкционные модели.

Чем заменить в 2026: русские нейросети для текста

Задачи, которые Порфирьевич не тянет, закрывают инструкционные модели. Ниже три варианта с данными из документации вендоров на 21 августа 2026 года. Цены и лимиты меняются, перед расчётом бюджета сверяйтесь с первоисточником по ссылке.

GigaChat

Модель Сбера. Для физических лиц действует freemium-режим: по тарифам для физлиц суммарно доступно 365 млн бесплатных токенов на 12 месяцев, из них 250 млн на модели Lite, 40 млн на Pro, 25 млн на Max и 50 млн на GigaChat 3 Ultra. Тарифы в документации указаны действующими с 1 февраля 2026 года. Платные пакеты начинаются с 1 300 рублей за 20 млн токенов Lite, пакет на 3 млн токенов Max стоит 1 950 рублей, то есть 650 рублей за миллион.

Контекст у GigaChat 2 Max заявлен в 128 000 токенов, модель принимает текст, изображения и аудио. Доступ без кода: сайт giga.chat и Telegram-бот @gigachat_bot, описанный в профиле как «Бесплатная нейросеть от Сбера». Для API нужна регистрация на developers.sber.ru.

YandexGPT (Yandex AI Studio)

Здесь важно изменение, о котором молчат старые обзоры: раздел документации yandex.cloud/ru/docs/foundation-models на 21 августа 2026 года отвечает редиректом 302 на yandex.cloud/ru/docs/ai-studio. Сервис переехал под бренд Yandex AI Studio, старые ссылки на foundation-models работают только через переадресацию.

Тарифы Яндекса зафиксировать не удалось: страницы цен закрыты проверкой на робота, а переносить числа из вторичных блогов мы не будем. Актуальный тариф смотрите на сайте вендора: aistudio.yandex.ru. Проверяемо без входа одно: доступ идёт через Яндекс ID и облачный биллинг, быстрого старта «зашёл и пишешь» здесь нет.

DeepSeek

Вариант для тех, кому нужен дешёвый API и очень длинный контекст. По официальному прайсу в линейке две основные модели, deepseek-v4-flash и deepseek-v4-pro, обе с контекстом в 1 млн токенов и максимумом 384 тыс. выходных. В пиковые часы ставка flash это 0,44 доллара за 1 млн входных токенов без попадания в кэш и 1,32 доллара за 1 млн выходных, у pro 1,32 и 3,96 доллара. Пиковыми на странице прайса названы 01:00 — 04:00 и 06:00 — 10:00 UTC, в остальные часы ставка вдвое ниже: 0,22 и 0,66 доллара у flash. Русский язык модель понимает, но требований по локальному хранению данных не закрывает.

Если задача не в русскоязычной специфике, а в качестве и цене на международном рынке, сравнение по инструментам мы собрали отдельно: лучшие зарубежные нейросети для текста.

Нужен не эксперимент, а работающий текстовый контур

Подбираем модель под задачу, считаем стоимость токенов на ваших объёмах и собираем процесс: промпты, шаблоны, проверка фактов, выгрузка в вашу систему. Без внедрения ради внедрения.

Обсудить задачу

Реклама. Neurounit

Сравнительная таблица

Данные проверены 21 августа 2026 года по документации вендоров и по открытому API Порфирьевича.

Модель Тип Русский язык Доступ Бесплатный тир
Порфирьевич Автодополнение, без инструкций Основной и единственный Сайт porfirevich.ru, боты @PorfBot и @NeuroPoetBot, открытый API Полностью бесплатно, до 150 токенов за запрос
GigaChat 2 / 3 Инструкционная, мультимодальная Основной Сайт giga.chat, бот @gigachat_bot, API на developers.sber.ru 365 млн токенов на 12 месяцев для физлиц
YandexGPT (Yandex AI Studio) Инструкционная Основной Вход по Яндекс ID, облачный биллинг Уточнить на aistudio.yandex.ru
DeepSeek V4 Инструкционная, с режимом рассуждений Поддерживается, не профильный API api-docs.deepseek.com, веб-чат Тарификация по токенам, от 0,22 доллара за 1 млн входных в льготные часы
ruGPT-3 large (ai-forever) Открытые веса, автодополнение Основной Hugging Face, локальный запуск Веса бесплатны, платите за своё железо

Как получить приличный русский текст: промпт

Порфирьевичу промпт не поможет: он не читает инструкции. Для GigaChat, YandexGPT и DeepSeek работает один каркас из пяти блоков, который снимает большую часть правок ещё до первой вычитки.

  1. Роль и предметная область. «Ты технический редактор компании, которая продаёт промышленные насосы». Без роли модель уходит в общую маркетинговую интонацию.
  2. Задача и формат. Текст на 2 500 знаков, четыре подзаголовка, таблица на пять строк, без вступления.
  3. Фактура. Цифры, названия, ограничения списком. Всё, чего вы не дали, модель придумает.
  4. Аудитория и стоп-лист. Кто читает и какие слова запрещены: без стоп-листа правка занимает больше времени, чем сама генерация.
  5. Критерий приёмки. «Каждый абзац содержит проверяемый факт: цифру, срок, название или ограничение. Абзац без факта удалить».

После генерации вычищаются слова-маркеры, по которым текст читается как машинный. Восемь самых частых в русскоязычной генерации:

  • «в современном мире»
  • «стремительно развивается»
  • «играет важную роль»
  • «является неотъемлемой частью»
  • «в эпоху цифровизации»
  • «широкий спектр возможностей»
  • «позволяет значительно повысить»
  • «не только, но и»

Ни одна из этих конструкций не несёт информации: убрать её можно без потери смысла. Поиском по документу все восемь вычищаются за пару минут. Как встроить это в поток работы, разобрано в материале про нейросеть для копирайтинга.

Коротко: нейросеть Порфирьевич в 2026

  • 2019 год, Михаил Гранкин. Репозиторий ru_transformers создан 23 сентября 2019 года, лицензия Apache 2.0, 764 звезды.
  • GPT-2 на 124 и 355 млн параметров. Обучение на корпусе 230 ГБ, дообучение на 500 МБ русской классики, лучшая перплексия 20,97 у Medium.
  • Код заморожен, сервис живёт. Последний коммит 7 декабря 2020 года, репозиторий в архиве, но API отвечает и галерея пополняется, свежая история от 15 августа 2026 года.
  • Не GPT-2 по умолчанию. Эндпоинт /models отдаёт пять сборок (lawa, mig, original, gpt3, frida), модель по умолчанию gpt3, лимит 150 токенов за запрос.
  • Для работы берут другое. GigaChat с 365 млн бесплатных токенов на год, Yandex AI Studio с входом по Яндекс ID, DeepSeek V4 с контекстом на 1 млн токенов.

Частые вопросы

Порфирьевич всё ещё работает в 2026 году?

Да. На 21 августа 2026 года сайт porfirevich.ru открывается, эндпоинт /health возвращает true, а запрос к /generate/ отдаёт три варианта продолжения примерно за полторы секунды. Галерея историй пополняется, последняя запись на момент проверки датирована 15 августа 2026 года.

Порфирьевич бесплатный и нужна ли регистрация?

Бесплатный, регистрация для генерации не требуется. Вход через соцсети нужен, только чтобы публиковать истории в общую галерею и ставить лайки. Проект принимает добровольную поддержку через Boosty и Patreon.

Подойдёт ли он для коммерческих текстов?

Нет. Он не выполняет инструкции: мы отправили ему прямой запрос «Напиши список из пяти преимуществ электромобиля.» на трёх моделях и ни разу не получили список. Плюс окно в 1024 токена и потолок 150 токенов за нажатие. Для карточек, рассылок и статей нужен инструкционный движок.

На чём именно обучали Порфирьевича?

Сначала на общем русском корпусе объёмом 230 ГБ, затем на 500 МБ русской классики. В README перечислены датасеты по Достоевскому, Толстому, Пушкину, Булгакову, Гоголю и Пелевину, а валидационным набором служила переписка Толстого с Ганди. Модель, которая работает на сайте, взята из папки Pelevin.

Можно ли запустить его у себя?

Да. Веса лежат в открытом S3 и скачиваются без регистрации командой aws s3 sync —no-sign-request s3://models.dobro.ai/gpt2/ru all, лицензия Apache 2.0 разрешает коммерческое использование. В репозитории есть два Colab-ноутбука: для дообучения и для подготовки корпуса. Учтите, что репозиторий заархивирован и зависимости из environment.yml придётся обновлять вручную.

Редакция Neurounit. Технические параметры получены из открытого репозитория проекта и его публичного API, тарифы взяты из документации вендоров. Дата проверки: 21 августа 2026 года.

Поделиться:
X
Редакция Neurounit

Разборы инструментов, гайды и новости про нейросети, AI-маркетинг и автоматизацию. Материалы готовит редакция агентства Neurounit.

Факты и цифры проверяет редакция агентства Neurounit. Вопросы и уточнения: Telegram.

Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга