Обычно про сервис пишут, когда он уже «упакован»: тарифы, лендинг, кейсы, отзывы. У меня всё наоборот — я хочу рассказать про «Слово» (slovotxt.ru) прямо сейчас, на стадии рабочего MVP, пока оплата ещё не до конца настроена и без красивой обёртки. Потому что мне кажется, что честная история запуска интереснее глянцевого пресс-релиза, и я всё равно ничего не скрываю — ни экономику, ни ограничения.
С чего всё началось
Я много учусь: смотрю обучающие видео, слушаю подкасты, часто в дороге. И там регулярно случается одно и то же — за рулём или в наушниках на ходу конспектировать не получается, а полезных мыслей за это время набирается много, и терять их не хочется. Хотелось собирать всё это в одном месте, применять на практике и передавать дальше, а не упускать.
Отдельно у меня есть доступ к закрытому обучению — сильному, но лекции там публикуются только на RUTUBE, и сами лекции длинные, часто часа по три. Я их смотрел, но копить материал из десятков таких лекций, а потом вручную искать в них нужный момент, — то ещё занятие. Хотелось собрать это в один большой рабочий материал, к которому можно возвращаться.
Я поискал готовые решения — и для RUTUBE транскрибатора просто не нашёл. Сервисы, которые попадались, делают текст из YouTube, и в лучшем случае отдают «голый» транскрипт — сплошной текст без разметки. А хотелось не просто текст, а сразу рабочий материал: конспект, ключевые мысли, задачи, которые из лекции следуют, — условно говоря, вытащить те самые несколько процентов по-настоящему важного из трёхчасовой записи, а не пересматривать всё целиком в их поисках.
Долгое время решения не было — тогда я ещё не умел пользоваться нейросетями настолько, чтобы собрать такое самому. Когда стало понятно, что с текущими AI-инструментами это реально сделать, родилась идея собрать транскрибатор самому — сначала просто для себя.
Как это устроено внутри
Схема простая на словах и не очень простая в реализации:
- Пользователь вставляет ссылку — RUTUBE, YouTube, VK Видео, TikTok — или загружает файл с компьютера.
- Сервис проверяет ссылку и право пользователя обрабатывать материал — это не техническая формальность: я сознательно не хочу, чтобы сервис превращался в инструмент обхода чужих ограничений.
- Авторизованный адаптер получает аудиопоток видео.
- Фоновая задача извлекает и нормализует звук, режет его на фрагменты — потому что распознавание не резиновое, и цельный пятичасовой файл одним запросом никто не обрабатывает.
- Каждый фрагмент распознаётся отдельно, результат склеивается обратно в единый транскрипт с таймкодами и разметкой по говорящим.
- Пользователь видит прогресс обработки и получает готовый текст — можно скачать в TXT или DOCX.
Под капотом — асинхронная обработка: сайт, локальный API и фоновый воркер, которые не блокируют друг друга, пока идёт распознавание. Это осознанное архитектурное решение: длина ролика не должна упираться в лимит одного запроса к модели.
Сколько это стоит на самом деле
Тут я не буду наводить тумана — реальные цифры себестоимости, как они есть в моих внутренних расчётах (без учёта получения потока с RUTUBE и налогов):
Распознавание речи с разделением говорящих я беру у AssemblyAI (Universal-2): это $0.15 за час записи плюс $0.02 за час на diarization — то есть около $0.17 на час видео за саму расшифровку.
Дальше — AI-обработка (конспект, главы, основные мысли) и немного инфраструктуры: временное хранение аудио и работа сервера. По прикидкам это ещё $0.05–0.65 в зависимости от длительности и того, какая языковая модель делает анализ. Итого ориентир по себестоимости:
- 1 час видео — примерно $0.22–0.37;
- 3 часа — примерно $0.61–0.91;
- 5 часов — примерно $1.00–1.50.
Это именно себестоимость, а не цена для пользователя — конечная цена должна умножаться минимум в 2–3 раза, чтобы покрыть неуспешные обработки, эквайринг, поддержку, хранение и остальную инфраструктуру. Эти расчёты — предварительные, я специально не выдаю их за окончательную истину: цены на распознавание я регулярно перепроверяю, и перед включением платного тарифа сверю их заново.
Что уже работает и что пока нет
Чтобы не создавать лишних ожиданий, честно про текущие границы:
- Источники видео — RUTUBE, YouTube, VK Видео, TikTok и загрузка файла с компьютера. В перспективе — ещё источники и настольное приложение.
- Экспорт — в TXT и DOCX. SRT — в планах на следующую итерацию.
- Лимит задания — до 5 часов на один ролик. Это осознанное ограничение первой версии, а не техническая случайность.
- Каждому пользователю доступно 30 бесплатных минут в месяц — специально, чтобы можно было спокойно протестировать сервис на своих материалах.
- Платные пакеты минут технически подключены (ЮKassa), но оплата ещё не до конца настроена и публично не работает — я в процессе. Показываю сервис сейчас именно потому, что мне важна обратная связь до того, как оплата заработает полностью, а не после.
- Исходное видео сервис не хранит после завершения обработки — только результат.
Отдельно скажу про то, чего сервис принципиально не делает: он не создавался как инструмент для обхода прав доступа к чужому контенту. Способ получения потока должен соответствовать правилам платформы и правам на конкретное видео — это не для галочки, а часть того, как я вижу продукт вдолгую.
Почему я пишу об этом сейчас
«Слово» начиналось как инструмент для себя — чтобы не терять мысли из длинных лекций и подкастов, которые смотрю и слушаю на ходу. Но раз я всё равно его строю, кажется честнее и полезнее показать сервис на этапе «работает, но не всё готово», чем ждать идеального момента, которого, как обычно бывает, не наступает никогда. Плюс мне правда нужна обратная связь: какие источники видео нужны в первую очередь, какие форматы экспорта важнее, на каких роликах распознавание спотыкается. Я буду читать все комментарии.
Если вам приходится регулярно превращать длинные видео или аудио в текст — лекции, интервью, подкасты, созвоны, — попробуйте, 30 минут в месяц бесплатно: slovotxt.ru. Вставляете ссылку или загружаете файл, ждёте обработки, получаете текст с таймкодами — скачать можно в TXT или DOCX.