📌Tencent Hunyuan відкрила AuK — універсальну модель для роботи з голосом
AuK об’єднує генерацію, редагування, очищення та розділення аудіо в одній моделі. Усі ці операції можна задавати звичайними текстовими інструкціями.
🔆Детальніше
• AuK має 1,5 млрд параметрів і підтримує клонування голосу за коротким аудіореференсом або створення нового голосу лише за його текстовим описом.
• Вже записане мовлення можна редагувати: додавати, видаляти або замінювати слова, зберігаючи голос, інтонацію та акустичний контекст. Так само можна змінювати слова в пісні без зміни мелодії.
• Текстовими інструкціями можна змінювати емоцію, тембр, акцент, шепіт, сміх, кашель, дихання, швидкість, гучність і висоту голосу.
• Модель також очищає записи, розділяє мовців, може ізолювати конкретного співрозмовника та витягувати вокал з музичного міксу.
• AuK-Flash — швидша версія моделі з 4-кроковим висновуванням. Код і ваги AuK опубліковані під ліцензією MIT.
➡️Демо тут.
➡️Код тут.
➡️Запроси друга до НейроЄнота🦝
📌Tencent Hunyuan відкрила AuK — універсальну модель для роботи з голосом
Нейроєнот | Нейромережа Midjourney, chat GPT та інші
@neuroenotЗахопливо про нейромережі та проривні технології. Ласкаво просимо у майбутнє. #добірка - добірка всіх новин за тиждень Для друга: https://t.me/neuroenot Співпраця та зв'язок: @New_Life_Technology
14 322 підписники
Відкрити в Telegram 1 відео додано до цього посту — доступно в додатку Telegram.