Обычно про сервис пишут, когда он уже «упакован»: тарифы, лендинг, кейсы, отзывы. У меня всё наоборот — я хочу рассказать про «Слово» (slovotxt.ru) прямо сейчас, на стадии рабочего MVP, пока оплата ещё не до конца настроена и без красивой обёртки. Потому что мне кажется, что честная история запуска интереснее глянцевого пресс-релиза, и я всё равно ничего не скрываю — ни экономику, ни ограничения.

С чего всё началось

Я много учусь: смотрю обучающие видео, слушаю подкасты, часто в дороге. И там регулярно случается одно и то же — за рулём или в наушниках на ходу конспектировать не получается, а полезных мыслей за это время набирается много, и терять их не хочется. Хотелось собирать всё это в одном месте, применять на практике и передавать дальше, а не упускать.

Отдельно у меня есть доступ к закрытому обучению — сильному, но лекции там публикуются только на RUTUBE, и сами лекции длинные, часто часа по три. Я их смотрел, но копить материал из десятков таких лекций, а потом вручную искать в них нужный момент, — то ещё занятие. Хотелось собрать это в один большой рабочий материал, к которому можно возвращаться.

Я поискал готовые решения — и для RUTUBE транскрибатора просто не нашёл. Сервисы, которые попадались, делают текст из YouTube, и в лучшем случае отдают «голый» транскрипт — сплошной текст без разметки. А хотелось не просто текст, а сразу рабочий материал: конспект, ключевые мысли, задачи, которые из лекции следуют, — условно говоря, вытащить те самые несколько процентов по-настоящему важного из трёхчасовой записи, а не пересматривать всё целиком в их поисках.

Долгое время решения не было — тогда я ещё не умел пользоваться нейросетями настолько, чтобы собрать такое самому. Когда стало понятно, что с текущими AI-инструментами это реально сделать, родилась идея собрать транскрибатор самому — сначала просто для себя.

Как это устроено внутри

Схема простая на словах и не очень простая в реализации:

  1. Пользователь вставляет ссылку — RUTUBE, YouTube, VK Видео, TikTok — или загружает файл с компьютера.
  2. Сервис проверяет ссылку и право пользователя обрабатывать материал — это не техническая формальность: я сознательно не хочу, чтобы сервис превращался в инструмент обхода чужих ограничений.
  3. Авторизованный адаптер получает аудиопоток видео.
  4. Фоновая задача извлекает и нормализует звук, режет его на фрагменты — потому что распознавание не резиновое, и цельный пятичасовой файл одним запросом никто не обрабатывает.
  5. Каждый фрагмент распознаётся отдельно, результат склеивается обратно в единый транскрипт с таймкодами и разметкой по говорящим.
  6. Пользователь видит прогресс обработки и получает готовый текст — можно скачать в TXT или DOCX.

Под капотом — асинхронная обработка: сайт, локальный API и фоновый воркер, которые не блокируют друг друга, пока идёт распознавание. Это осознанное архитектурное решение: длина ролика не должна упираться в лимит одного запроса к модели.

Сколько это стоит на самом деле

Тут я не буду наводить тумана — реальные цифры себестоимости, как они есть в моих внутренних расчётах (без учёта получения потока с RUTUBE и налогов):

Распознавание речи с разделением говорящих я беру у AssemblyAI (Universal-2): это $0.15 за час записи плюс $0.02 за час на diarization — то есть около $0.17 на час видео за саму расшифровку.

Дальше — AI-обработка (конспект, главы, основные мысли) и немного инфраструктуры: временное хранение аудио и работа сервера. По прикидкам это ещё $0.05–0.65 в зависимости от длительности и того, какая языковая модель делает анализ. Итого ориентир по себестоимости:

Это именно себестоимость, а не цена для пользователя — конечная цена должна умножаться минимум в 2–3 раза, чтобы покрыть неуспешные обработки, эквайринг, поддержку, хранение и остальную инфраструктуру. Эти расчёты — предварительные, я специально не выдаю их за окончательную истину: цены на распознавание я регулярно перепроверяю, и перед включением платного тарифа сверю их заново.

Что уже работает и что пока нет

Чтобы не создавать лишних ожиданий, честно про текущие границы:

Отдельно скажу про то, чего сервис принципиально не делает: он не создавался как инструмент для обхода прав доступа к чужому контенту. Способ получения потока должен соответствовать правилам платформы и правам на конкретное видео — это не для галочки, а часть того, как я вижу продукт вдолгую.

Почему я пишу об этом сейчас

«Слово» начиналось как инструмент для себя — чтобы не терять мысли из длинных лекций и подкастов, которые смотрю и слушаю на ходу. Но раз я всё равно его строю, кажется честнее и полезнее показать сервис на этапе «работает, но не всё готово», чем ждать идеального момента, которого, как обычно бывает, не наступает никогда. Плюс мне правда нужна обратная связь: какие источники видео нужны в первую очередь, какие форматы экспорта важнее, на каких роликах распознавание спотыкается. Я буду читать все комментарии.

Если вам приходится регулярно превращать длинные видео или аудио в текст — лекции, интервью, подкасты, созвоны, — попробуйте, 30 минут в месяц бесплатно: slovotxt.ru. Вставляете ссылку или загружаете файл, ждёте обработки, получаете текст с таймкодами — скачать можно в TXT или DOCX.

Если найдёте баг, странное распознавание или просто есть мнение о том, что важнее сделать дальше — пишите в поддержку в Telegram, буду рад любой обратной связи.