~100 млн email-листів
~500 млн повідомлень з Microsoft Teams
~30 млн рядків коду, бази даних, звіти про продуктивність та бюджетні документи з 1986 року
Google довелося добряче поборотися за ці дані. На аукціоні вони перебили ставку відомого AI-стартапу Mercor, який пропонував $7.5 млн
Головна фішка цієї покупки в тому, що під час знеособлення (деідентифікації) збережеться зв'язок між записами. Тобто, всі імена замінять на псевдоніми, але алгоритм збереже ланцюжок: від повідомлення в Teams до тікета в Jira і до конкретного коміту в коді. Саме така структура критично потрібна, щоб навчити ШІ розуміти контекст довгих задач
Закритий клуб | Корисні матеріали