Как сообщает VentureBeat, Composio протестировала V4 Flash на 30 намеренно сложных многошаговых задачах, в которых использовались Gmail, GitHub, Slack и Google Sheets. Модель запускали через восемь агентных оболочек, включая Claude Code, Codex и OpenCode.
Успешными оказались 129 из 240 прогонов. Общая доля выполнения составила 53,8%. При этом все протестированные оболочки справились лишь с шестью из 30 сценариев. Результаты одной и той же модели заметно различались в зависимости от оболочки, конфигурации инструментов, кэширования, повторных попыток и провайдера.
DeepSeek также сообщила о предстоящем повышении цен на V4 Flash и Pro. Разработчики используют эти модели для создания ассистентов для программирования и агентов.
Ключевые факты
Composio провела 240 прогонов на 30 сложных многошаговых задачах.
Успешными оказались 129 прогонов, общая доля выполнения составила 53,8%.
Только шесть из 30 сценариев выполнили все протестированные агентные оболочки.
DeepSeek сообщила о предстоящем повышении цен на V4 Flash и Pro.
Вопросы и ответы
- На каких рабочих сценариях проверяли модель?
Тест охватил 30 сложных многошаговых задач в Gmail, GitHub, Slack и Google Sheets: всего 240 прогонов через восемь агентных оболочек.
- На какую базовую надежность можно ориентироваться при внедрении?
Успешными были 129 из 240 прогонов, то есть 53,8%. Все восемь оболочек справились лишь с шестью из 30 сценариев.
- Что команде нужно сравнивать помимо самой модели?
Результат зависел от агентной оболочки, конфигурации инструментов, кэширования, повторных попыток и провайдера. В тесте сравнивали восемь оболочек, включая Claude Code, Codex и OpenCode.
Контекст по теме
- Ox Alpha оказалась моделью GLM-5.3-Flash от Z.ai27 августа 2026 г.
- Perplexity и Nvidia запускают локального ИИ-агента Portable Computer25 августа 2026 г.
- Claude Tag в Slack стал учитывать всю беседу перед вмешательством24 августа 2026 г.
- Muse Glimmer рассчитана на локальные агентные процессы на PC и Mac11 августа 2026 г.