Google Lyria 3.5 оновлення ШІ з точним редагуванням аудіо

Оновлення музичної моделі від Google DeepMind

Компанія Google офіційно презентувала оновлену версію своєї генеративної аудіомоделі Lyria 3.5. Музичний інструмент отримав вищу точність синтезу мовлення, розширений діапазон інтонацій та нові алгоритми редагування окремих фрагментів композиції. Основна мета релізу полягає у забезпеченні точного контролю над структурами треку, ритмом та текстом без необхідності повного повторного рендерингу аудіофайлу. Це дозволяє суттєво прискорити процес створення супроводу для медіапроєктів та спростити фінальне зведення матеріалу.

Нова версія інтегрована у платформу Google Flow Music та доступна розробникам через Gemini API. Модель орієнтована на саунд-дизайнерів, творців контенту та авторів музики, яким потрібні гнучкі інструменти прототипування звукових доріжок. Завдяки новим алгоритмам користувачі можуть коригувати тональність та інструментування без втрати цілісності всієї партитури.

Порівняння можливостей моделей Google Lyria
Параметр Lyria 3.0 Lyria 3.5
Максимальна тривалість треку 60 секунд 180 секунд
Частота дискретизації 24 kHz 44.1 kHz
Точне редагування ділянок (Inpainting) Ні Так
Контроль темпу (BPM) Базовий Точний
Розподіл на мультитреки (Stems) Ні Так

Природність вокалу та інтонаційний аналіз

Головним досягненням розробників стала інтеграція нових нейромережевих архітектур для синтезу людського голосу. Попередні покоління алгоритмів часто створювали штучні артефакти на високих частотах і мали проблеми з динамікою дихання. Lyria 3.5 враховує акустичні особливості вокальних резонаторів, що дає змогу отримувати природне звучання як у сольних партіях, так і у багатоголоссі. Система аналізує контекст супроводу і підлаштовує гучність та форманти вокалу під інструментальну підкладку.

Покращена артикуляція та фонетична точність

Модель краще обробляє складні тексти та швидкотемпові фрагменти. Зменшено кількість ситуацій, коли штучний інтелект проковтує склади або викривляє приголосні звуки. Це дозволяє працювати з різними жанрами, включно з хіп-хопом, де швидкість вимови є критичним параметром. Нейромережа також навчилася точно відтворювати особливості акцентів та мікроінтонацій, що робить звучання більш емоційним.

  • Покращено синтез вібрато та динамічних переходів між нотами.
  • Додано підтримку природних пауз та зітхань для реалізму.
  • Зменшено фазові викривлення на спектрограмі аудіосигналу.
  • Забезпечено коректну обробку складних фонетичних сполучень.

Гнучке редагування та інструменти контролю

Найбільшим технічним кроком уперед стала поява функції локального редагування. Раніше зміна одного слова або ноти вимагала повної регенерації аудіофайлу, що змінювало весь вихідний результат. Тепер користувачі можуть виділяти конкретний часовий проміжок і змінювати лише необхідний елемент. Це дає можливість зберігати вдалі пасажі, виправляючи лише поодинокі огріхи генерації.

Точкова зміна тексту та інструментування

Завдяки алгоритмам точкового редагування можна переписати окремий рядок пісні, змінити соло-інструмент або коригувати темп на окремому відрізку композиції. Система зберігає загальну тональність, акустичне середовище та реверберацію початкового треку, забезпечуючи непомітний перехід між оригінальним і згенерованим фрагментом.

  1. Виділення часового інтервалу на часовій шкалі редактора.
  2. Введення нового текстового промту або текстового фрагмента.
  3. Автоматична адаптація темпу, тональності та реверберації.
  4. Експорт відредагованого аудіопотоку без втрати якості.

Інтеграція в екосистему розробників

Розробники отримали доступ до Lyria 3.5 через Gemini API, що дозволяє вбудовувати генерацію музики у сторонні додатки, цифрові звукові робочі станції та ігрові рушії. Завдяки низькій затримці обробки запитів модель можна використовувати для динамічного створення саундтреків у реальному часі. Це відкриває нові можливості для інтерактивного адаптивного звукового супроводу у відеоіграх.

Технічні вимоги та формати експорту

Генерований аудіопотік експортується у нестиснутих форматах WAV та FLAC із частотою дискретизації 44.1 kHz та глибиною 24 біти. Це відповідає стандартам для подальшого зведення та майстерингу у професійному програмному забезпеченні.

Безпека та захист авторських прав

Google продовжує впроваджувати технології маркування контенту. Усі аудіофайли, створені за допомогою Lyria 3.5, містять невидимий цифровий водяний знак SynthID. Цей маркер стійкий до стиснення, обрізання та накладання шумів, що дозволяє точно визначати походження файлу навіть після його модифікації.

Сергій Кодеренко
Про автора

Сергій Кодеренко

Ентузіаст автоматизації, досвідчений розробник, на його плечах велика відповідальність за розробку проекту.

0 Коментарів

Відповісти

2500
Будь ласка, введіть коментар
Будь ласка, вкажіть ваше ім'я