Пройти тему
🤖 AI для жизни и работы · 🎨 Мультимодальный AI

AI-видео: первые шаги

Runway, Pika: видео из текста и изображений

Введение

Голос — следующий рубеж AI после текста и изображений. Современные технологии позволяют превращать речь в текст и текст в речь с качеством, неотличимым от человеческого. В этом уроке вы научитесь использовать AI для транскрипции, озвучки и создания аудиоконтента.

---

Два направления голосового AI

| Направление | Что делает | Инструменты | |-------------|------------|-------------| | Speech-to-Text | Речь → Текст | Whisper, Google Speech | | Text-to-Speech | Текст → Речь | ElevenLabs, Google TTS |

---

Speech-to-Text: транскрипция

Whisper (OpenAI)

Что это: AI-модель для распознавания речи с высокой точностью.

Где использовать:

  • Встроено в ChatGPT (голосовой режим)
  • Отдельные сервисы: whisper.ggerganov.com, huggingface.co
  • Локально на компьютере (для продвинутых)
Возможности:
  • Распознавание 99+ языков
  • Автоматическое определение языка
  • Расстановка пунктуации
  • Работа с акцентами и шумом
Практические применения:

| Задача | Как использовать | |--------|------------------| | Транскрипция интервью | Загрузить аудио → получить текст | | Конспект лекции | Записать → транскрибировать → структурировать | | Голосовые заметки | Надиктовать → текст | | Субтитры для видео | Транскрипция + таймкоды | | Протоколы встреч | Запись Zoom → текст |

Google Speech-to-Text

Где: Google Cloud, встроено в Google Docs

Как использовать в Google Docs:

  • Откройте Google Документ
  • Инструменты → Голосовой ввод
  • Говорите — текст появляется автоматически
  • Плюсы:

    • Бесплатно в Google Docs
    • Работает в реальном времени
    • Хорошо понимает русский
    ---

    Text-to-Speech: озвучка

    ElevenLabs

    Сайт: elevenlabs.io Что это: Лидер в генерации реалистичной речи.

    Возможности:

    • Голоса, неотличимые от человеческих
    • 29+ языков, включая русский
    • Клонирование голоса (с вашего образца)
    • Настройка эмоций и стиля
    • Voice Design — создание уникального голоса
    Тарифы:
    • Free: 10 000 символов/месяц (~10 мин)
    • Starter: $5/мес — 30 000 символов
    • Creator: $22/мес — 100 000 символов
    Практические применения:
    • Озвучка статей и постов
    • Аудиоверсии блога
    • Голос для видео
    • Подкасты без записи голоса
    • Прототипы голосовых ассистентов

    Как использовать ElevenLabs

  • Зарегистрируйтесь на elevenlabs.io
  • Выберите голос из библиотеки
  • Вставьте текст
  • Настройте параметры (скорость, эмоции)
  • Генерируйте и скачивайте
  • Настройки голоса:

    • Stability — стабильность (выше = ровнее)
    • Similarity — похожесть на оригинал
    • Style — экспрессивность
    • Speed — скорость речи
    ---

    Клонирование голоса

    Как это работает

  • Загружаете образец своего голоса (1-5 минут чистой речи)
  • AI обучается на образце
  • Можете генерировать любой текст своим голосом
  • Этические аспекты

    Можно:

    • Клонировать свой голос
    • Клонировать с явного согласия человека
    • Использовать для личных проектов
    Нельзя:
    • Клонировать голоса без разрешения
    • Создавать дипфейки
    • Использовать для обмана

    Практический пример

    ` Задача: Создать аудиоверсию блога своим голосом.

  • Записать 5-минутный образец (чётко, без шума)
  • Загрузить в ElevenLabs → Professional Voice Cloning
  • Дождаться обучения (несколько часов)
  • Генерировать статьи своим голосом
  • `

    ---

    Голосовые ассистенты с AI

    ChatGPT Voice Mode

    Как включить:

    • Мобильное приложение ChatGPT
    • Нажать на иконку наушников
    • Говорить и слушать
    Возможности:
    • Разговор с AI голосом
    • Понимание контекста
    • Естественные паузы и интонации

    Практические сценарии

    Мозговой штурм на ходу:

    • Идёте/едете и обсуждаете идеи с AI
    • AI записывает и структурирует
    Изучение языка:
    • Практика разговорного языка с AI
    • Исправление ошибок в реальном времени
    Диктовка заметок:
    • Надиктовать мысли
    • AI структурирует в текст
    ---

    Создание аудиоконтента

    Аудиоверсия статьи

    Workflow:

  • Напишите статью (или используйте существующую)
  • Адаптируйте для аудио:
  • ` Перепиши эту статью для аудиоформата:
    • Убери визуальные ссылки ("на картинке выше")
    • Добавь переходы между разделами
    • Сделай предложения короче
    • Добавь интонационные паузы (...)
    [текст статьи] `
  • Озвучьте в ElevenLabs
  • Добавьте музыку/интро (опционально)
  • Подкаст с AI

    Сценарий solo-подкаста: ` Напиши сценарий для 10-минутного подкаста.

    Тема: [тема] Формат: один ведущий Стиль: дружеский, информативный

    Структура:

  • Интро с крючком (30 сек)
  • Основная тема (7-8 мин)
  • Практические советы (2 мин)
  • Завершение и призыв к действию (30 сек)
  • Включи: паузы для дыхания, переходные фразы. `

    Аудиокнига

    Для длинных текстов:

  • Разбейте на главы
  • Озвучьте каждую отдельно
  • Соедините в аудиоредакторе (Audacity — бесплатный)
  • ---

    Субтитры и каptions

    Автоматические субтитры

    YouTube:

    • Загружает видео → автоматические субтитры
    • Можно скачать и редактировать
    Специализированные сервисы:
    • Descript — транскрипция + редактирование видео
    • Otter.ai — транскрипция встреч
    • Rev — профессиональная транскрипция

    Субтитры для контента

    Зачем нужны:

    • 85% видео в соцсетях смотрят без звука
    • Доступность для людей с нарушениями слуха
    • SEO — текст индексируется
    • Понимание акцента
    ---

    Практическое задание

    Цель

    Транскрибировать аудио и озвучить текст.

    Часть 1: Транскрипция

  • Найдите аудиозапись (или запишите 2-3 минуты речи)
  • Транскрибируйте:
  • - Через ChatGPT (загрузите файл) или [@gptmug_bot](https://t.me/gptmug_bot) в Telegram - Или через whisper-сервис онлайн (ggwhatsapp.io, speech-to-text.ru)
  • Оцените качество:
  • - Точность распознавания - Пунктуация - Обработка имён/терминов

    Часть 2: Озвучка

  • Зарегистрируйтесь на elevenlabs.io
  • Выберите голос из библиотеки
  • Озвучьте текст (100-200 слов):
  • ` Привет! Это тестовая озвучка, созданная с помощью искусственного интеллекта. Современные технологии позволяют создавать речь, практически неотличимую от человеческой. Это открывает огромные возможности для создания контента. `
  • Поэкспериментируйте с настройками голоса
  • Скачайте результат
  • Результат

    • Транскрибированный текст
    • Аудиофайл с озвучкой
    ---

    Домашнее задание

    Создайте аудиоконтент:

    Вариант 1: Озвучка статьи

    • Возьмите свою статью/пост
    • Адаптируйте для аудио
    • Озвучьте
    Вариант 2: Мини-подкаст
    • Напишите сценарий (3-5 минут)
    • Озвучьте
    • Добавьте интро (опционально)
    Вариант 3: Транскрипция встречи
    • Запишите рабочий созвон
    • Транскрибируйте
    • Создайте структурированные заметки
    ---

    Пройти эту тему с проверкой Разбор вопросов и зачёт — бесплатно, без регистрации

    Другие темы курса «AI для жизни и работы»

    Другие курсы