← Все новости·2026-07-03·3 мин чтения

GPT и Claude провалили тест Bridgewater — дообученная модель выиграла

Bridgewater и Thinking Machines Lab проверили GPT, Claude и Gemini на финансовых задачах: победила Qwen3-235B с 84,7% точности и стоимостью в 14 раз ниже.

aifinanceresearchllm

Bridgewater и Thinking Machines Lab протестировали GPT, Claude и Gemini на шести задачах из повседневной работы инвестиционных аналитиков: оценка сигналов центробанков о процентных ставках, определение релевантности статей для управляющих, суждения о финансовых документах. Лучшие frontier-модели с базовыми запросами показали около 50% точности; с детальными экспертными инструкциями — середину 70-х процентов. GPT 5.4 при этом стоит на 43% дороже аналогов, но обеспечивает результат «лишь немного лучше».

Победитель неожиданный: открытая Qwen3-235B, дообученная на внутренних примерах Bridgewater, достигла 84,7% точности при стоимости в 14 раз ниже frontier-моделей. Объяснение простое: правильные ответы на эти задачи никогда не попадали в открытый интернет, поэтому frontier-модели — при всей мощи — их просто не видели в обучении. Исследование показывает: огромные корпоративные базы закрытых данных остаются незадействованными крупными лабораториями, и компании могут строить точные специализированные системы, не передавая свои данные внешнему провайдеру.

Источник: the-decoder.com

Бесплатный курс

Хватит читать про ИИ — начни строить с ним

Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.

Начать →
ЕАЕвгений Арсентьев

Автор

Евгений Арсентьев

PhD · CEO, digital health