За цей бенчмарк ми всі будемо горіти у ШІ-пеклі — LLM-моделі змусили грати в Overcooked 😂
Ясна річ, що сенс гри трохи змінили: моделі все ще треба готувати їжу, мити посуд та й таке інше, але усі дії оформлені через tool/function calls. Себто модель отримує замовлення й будує в голові план, а в симуляції час не зупиняється — якщо модель занадто довго тупить, то котлета згорить, віртуальний клієнт буде злитися, а очки за приготовану страву — втрачатися 🤬
Мета: перевірити не тільки правильність, а й швидкість виконання завдань ШІ-агентами.
Результати лідерів бенчмарку — на відео.
ооо донат на збір (залишилося 73 490.33)
За цей бенчмарк ми всі будемо горіти у ШІ-пеклі — LLM-моделі змусили грати в Overcooked 😂 Ясна річ,
Ооо нейромережеве🐱
@oooneuroCOFFEE AI MEOW REPEAT По рекламі: @ad_kitty Інші питання: @neurokit Посилання для друзів: https://t.me/+bXCkQ_uagrozYzVi Навігація за хештегами: https://t.me/c/1591600888/2976 Монобаза: https://base.monobank.ua/EhJBDcb6zd52Ni
26 149 підписників
Відкрити в Telegram 1 відео додано до цього посту — доступно в додатку Telegram.