🪙 Google випустили Gemini 3.8 Flash TTS — голос можна пропистати промтом, підтримує понад 100 мов. Можна генерувати повноцінні діалоги, охи, вздохи та й таке інше теж у наявності 💃
🪙 Alibaba дропнули Qwen-Audio-3.1 — аж 4 моделі: для розпізнавання мови, для розпізнавання мови з додатковими мітками, для клонування та TTS, а також для створення звукових ефектів;
🪙 Новий стартап FishAudio релізить Drama 3 — «найконтрольованішу модель TTS усіх часів». Аудіотеги не потрібні, тон, темп та характер можна описати звичайними словами — завдяки цьому можна змінити звучання посеред речення. Поки лише превью.
Лишилося лише одне питання: хто такий Sonic 3 😁
ооо збори живуть дуже дякую (залишилося 31 164.79)