Політичні новини України та світу

Рівень Fable 5.1 за набагато нижчу ціну: Anthropic презентувала оновлену модель Claude Opus 5.5.

Розробники зменшили вартість використання на 40%, розширили ліміти та прискорили роботу системи.

Anthropic анонсувала Claude Opus 5.5 — першу модель нового покоління штучного інтелекту в сімействі Claude 5.5. За словами компанії, ця модель об'єднує високу продуктивність Claude Fable 5.1 з більш доступними витратами на використання. Claude Opus 5.5 є найбільш значним оновленням з моменту виходу Claude Opus 5, отримавши вдосконалені механізми безпеки, прискорену генерацію відповідей та значне зниження витрат при роботі через API. Розробники зазначили, що Opus 5.5 вже доступна на платформах Claude, Amazon Web Services, Google Cloud та Microsoft Azure.

Які нововведення в новій моделі?

Anthropic заявляє, що Claude Opus 5.5 показує найкращі результати серед її моделей у програмуванні, роботі з великими обсягами знань та використанні комп'ютера. За даними компанії, один із ранніх тестувальників завершив міграцію кодової бази обсягом 680 тисяч рядків менш ніж за добу -- завдання, яке зазвичай займає у команди інженерів кілька тижнів.

У процесі внутрішніх тестувань нова модель продемонструвала вражаючу здатність оптимізувати швидкість завантаження вебдодатків у 39 з 40 випадків, а також ефективно справлялася з великими аудитами коду. Наприклад, аналіз кодової бази обсягом 200 тисяч рядків у версії Opus 5.5 було завершено менш ніж за три години, тоді як попередня версія Opus 5 витратила понад 20 годин і використала в 2,5 рази більше токенів.

Окрему увагу Anthropic приділила якості письма. За словами розробників, Opus 5.5 рідше використовує складний жаргон, швидше переходить до головної думки та краще дотримується заданого стилю спілкування.

Результати випробувань

В компанії повідомили, що на бенчмарку Terminal-Bench 4.0 їхня модель отримала 66,4%, перевершивши результати Claude Fable 5.1 (55,8%) та Claude Opus 5 (52,3%). На платформі GDPval-AA v2.1, що аналізує професійні завдання в 44 сферах, Opus 5.5 демонструє рейтинг 1846 Elo, тоді як Fable 5.1 має 1735. Одночасно Anthropic зазначає, що лабораторні випробування все менш точно відображають справжні відмінності між найсильнішими моделями, тому компанія зосереджується на практичних сценаріях застосування.

Ціна моделі

Одним із ключових нововведень стала оновлена цінова стратегія. Ціна на вхідні токени знизилася з 5 до 4 доларів за мільйон, вихідні токени тепер коштують 20 доларів замість попередніх 25, а вартість читання кешу зменшилася на 60%, тепер складаючи лише 0,20 долара за мільйон токенів.

Згідно з аналізом Anthropic, при звичайних умовах експлуатації Opus 5.5 є приблизно на 40% економічніше в порівнянні з Opus 5. Компанія також зазначила, що нова модель забезпечує швидші відповіді, перевищуючи попередника більш ніж на 30%. Додатково, для абонентів тарифів Pro, Max, Team і Enterprise були підвищені п'ятигодинні обмеження використання, а також введена можливість накопичувати скидання швидкісних лімітів і використовувати їх у майбутньому.

Безпека та нові обмеження

Перед випуском модель пройшла тестування в незалежних організаціях Frontier Design і METR. За інформацією Anthropic, Opus 5.5 досягла статусу найкращої моделі компанії в сфері автоматизованого аудиту поведінки — системи, яка аналізує ШІ у близько двох тисячах змодельованих ситуацій.

У компанії також заявляють, що модель приблизно на 85% рідше намагалася обходити встановлені обмеження, ніж Opus 5 або Claude Mythos 5.1. При цьому Anthropic визнає, що оцінювання поведінки моделей усе ще має обмеження, оскільки сучасні системи дедалі частіше здогадуються, що проходять тестування.

Через високі можливості у кібербезпеці та біології Opus 5.5 отримав додаткові захисні механізми. Більшість запитів із кібербезпеки за замовчуванням перенаправлятимуться на менш потужну модель Opus 4.8, а академічні лабораторії, фармацевтичні компанії та стартапи зможуть отримати розширений доступ через окрему програму верифікації.

Нова модель зʼявилася на тлі масштабної дискусії в галузі ШІ щодо безпеки великих мовних моделей (LLM). Нагадаємо, що саме генеральний директор Anthropic закликав до скоординованого уповільнення темпів розвитку технології, і його тоді підтримали керівник OpenAI Сем Альтман та глава SpaceXAI Ілон Маск, який напередодні також випустив нову модель ШІ Grok 4.7. Занепокоєння лідерів індустрії раніше викликали ризики неконтрольованого самовдосконалення алгоритмів та інциденти зі зламами реальних систем.

Читайте також