GPT и Claude провалили тест Bridgewater — дообученная модель выиграла
Bridgewater и Thinking Machines Lab проверили GPT, Claude и Gemini на финансовых задачах: победила Qwen3-235B с 84,7% точности и стоимостью в 14 раз ниже.
Bridgewater и Thinking Machines Lab протестировали GPT, Claude и Gemini на шести задачах из повседневной работы инвестиционных аналитиков: оценка сигналов центробанков о процентных ставках, определение релевантности статей для управляющих, суждения о финансовых документах. Лучшие frontier-модели с базовыми запросами показали около 50% точности; с детальными экспертными инструкциями — середину 70-х процентов. GPT 5.4 при этом стоит на 43% дороже аналогов, но обеспечивает результат «лишь немного лучше».
Победитель неожиданный: открытая Qwen3-235B, дообученная на внутренних примерах Bridgewater, достигла 84,7% точности при стоимости в 14 раз ниже frontier-моделей. Объяснение простое: правильные ответы на эти задачи никогда не попадали в открытый интернет, поэтому frontier-модели — при всей мощи — их просто не видели в обучении. Исследование показывает: огромные корпоративные базы закрытых данных остаются незадействованными крупными лабораториями, и компании могут строить точные специализированные системы, не передавая свои данные внешнему провайдеру.
Источник: the-decoder.com
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →▌ Гайды по теме

Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи