В Anthropic додали команду
claude plugin eval, яка показує, чи справді плагін покращує результат роботи Claude.🔆Детальніше
• Claude допомагає створити тестові приклади та критерії оцінювання для плагіна.
• Кожен тест запускається з плагіном і без нього, щоб можна було порівняти результати.
• У підсумку система показує оцінки та різницю між двома варіантами.
• Результати можна переглянути у детальному HTML-звіті.
• Оскільки тести використовують модельні виклики, Anthropic радить для перших перевірок запускати їх з
--runs 1, щоб зменшити витрати.➡️Детальніше тут.
➡️Запроси друга до НейроЄнота🦝