Надежное использование инструментов (функций) большими языковыми моделями является ключевым свойством агентных систем, однако существующие бенчмарки не обеспечивают систематического контроля структурной сложности задач, что затрудняет выявление границ применимости моделей. Создан бенчмарк MultiCAT-Bench для детализированной категоризованной оценки использования инструментов большими языковыми моделями, содержащий 3789 тестовых задач, сгенерированных автоматически по десяти категориям сложности (число вызываемых и доступных функций, структура параметров, композиционность вызовов, опциональность вызовов и лингвистический шум), обеспечивающий контролируемый анализ производительности моделей по каждой категории, и позволяющий выявлять, что основным режимом отказа является пропуск информации (средняя полнота 72,4 % при точности 88,3 %), при этом наибольшее влияние на точность оказывают число вызовов, опциональность параметров и их количество; лучшие результаты на бенчмарке показали модели Grok 4.1 Fast (83,8 %) и GPT-5 Mini (83,7 %).
Разработка соответствует Концепции научно-технологического развития Санкт-Петербурга в области создания передовых методов оценки и тестирования систем искусственного интеллекта для критических применений.
Vyatkin A., Poptsov A., Oliseenko V., Veiber E., Shutko O., Rafikov T., Abramov M., Nikolenko S.I. MultiCAT-Bench: A Multi-Categorical Agent Tool Use Benchmark // IEEE Access. 2026. Vol. 14. P. 116036–116058. https://doi.org/10.1109/ACCESS.2026.3710376