Повноцінний реліз DeepSeek V4.1 Flash
Нова модель отримала 552 млрд параметрів, але за один токен використовує лише 8 млрд при обробці вхідних даних та 16 млрд при генерації. За рахунок цього DeepSeek робить акцент на довгих агентних завданнях, де моделі доводиться постійно працювати з величезним контекстом.
Головна зміна всередині моделі пов'язана з KV Cache. DeepSeek скоротила його розмір до 890 байт на токен, приблизно в чотири рази менше за минулу V4 Flash. Це знижує вимоги до пам'яті під час роботи з довгими діалогами, кодовими базами та агентами.
Модель мультимодальна, розуміє текст і зображення, підтримує контекст до 1 млн токенів і дозволяє вручну задавати глибину міркувань від 1 до 100.
На DeepSWE v1.1 вона отримала 74,2%, Terminal Bench 2.1 набрала 90,6%, а на CyberGym — 88,1%. У кількох агентних тестах V4.1 Flash обходить GPT-5.6 Sol та Claude Opus 5.0.
Ваги вже лежать на Hugging Face під ліцензією MIT.
Повноцінний реліз DeepSeek V4.
25,779 subscribers
Open in Telegram 