Сьогодні по **ElevenLabs** нанесли координовану атаку з трьох позицій, ~~я зараз вам покажу, я мапу приніс~~:

 Google [випустили](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/) **Gemini 3.8 Flash TTS** — голос можна пропистати промтом, підтримує понад 100 мов. Можна генерувати повноцінні діалоги, охи, вздохи та й таке інше теж у наявності 

 Alibaba [дропнули](https://fun-resource-shanghai.oss-cn-shanghai.aliyuncs.com/cuijiayan.cjy/tmp/exp/qwen_audio_3_tts_blog_review_260918/index.shtml?Expires=2105366399&OSSAccessKeyId=LTAI5tQrCBwj82sVMCWoSmzE&Signature=9ZaZIEahoN41Zb9MFJjf34G%2BSCM%3D) **Qwen-Audio-3.1** — аж 4 моделі: для розпізнавання мови, для розпізнавання мови з додатковими мітками, для клонування та TTS, а також для створення звукових ефектів;

 Новий стартап **FishAudio** релізить **Drama 3** — «найконтрольованішу модель TTS усіх часів». Аудіотеги не потрібні, тон, темп та характер можна описати звичайними словами — завдяки цьому можна змінити звучання посеред речення. Поки лише [превью](https://x.com/FishAudio/status/2102805658005635294?s=20).

Лишилося лише одне питання: хто такий **Sonic 3** 

[ооо збори живуть дуже дякую (залишилося 31 164.79)](https://send.monobank.ua/jar/33jo31bNu4)