Бесплатный чат-бот DeepSeek серьезно прокачали: он стал намного мощнее

«Рассуждающая» модель может посоревноваться с o1 от OpenAI в математике и программировании. Рассказываем, как ее протестировать.

Китайская компания DeepSeek выпустила новую модель искусственного интеллекта DeepSeek-R1, которая, по утверждению разработчиков, демонстрирует производительность, сопоставимую с моделью o1 от OpenAI. При этом ее код открыт, а еще она работает в России без ограничений.

О релизе DeepSeek объявила в соцсети X. DeepSeek-R1 способна к самопроверке, рефлексии и генерации длинных цепочек рассуждений. Компания поделилась результатами новой модели в различных тестах, оценивающих способности ИИ.

Оценка математических способностей DeepSeek-R1 проводилась на двух различных бенчмарках: MATH-500 и AIME 2024. В первом модель достигла показателя 97.3%, чуть больше, чем у o1 от OpenAI (96.4%). Во втором DeepSeek-R1 набрал 79.8%, а o1 — 79.2% В тесте на логическое мышление и общие знания (MMLU) DeepSeek-R1 показала результат 90.8%, что близко к показателю OpenAI-o1-1217 (91.8%).

Оценка DeepSeek-R1 в задачах, требующих навыков программирования, проводилась с использованием бенчмарков SWE-bench Verified, Codeforces и GPQA Diamond. В первом DeepSeek-R1 демонстрирует результат 49.2%. Этот показатель незначительно выше, чем у o1 (48.9%). На платформе Codeforces китайская модель достигла 96.3%, что чуть ниже результата o1 (96.6%). В тесте GPQA Diamond результат DeepSeek-R1 составил 71.5% а o1 — 75.7%. При этом R1 обошла o1-mini во всех бенчмарках.

Источник: hi-tech.mail.ru

0 0 голоса

Рейтинг новости

1995

0 комментариев

Межтекстовые Отзывы

Посмотреть все комментарии

Даниэль Злобин к записи «Сбер»: международная IT-олимпиада GO.IT для школьников стартовала в России: “Здорово, что продолжают у нас организовываться подобные мероприятия, это опыт, в частности обмен опытом и большие возможности.”

Антон Терехов к записи LG прекращает выпуск Blu-ray-плееров: “Очень странная статья! Как так получается, что компания LG запустила впервые блюрей проигрыватели только в 2018 году? У меня имеется…”

Антон Терехов к записи Blu-ray диски получили второй шанс: “А разве у нас мало людей в стране, у которых есть и блюрей проигрыватели, саундбары с блюрей приводом, домашние кинотеатры…”

Дмитрий Любинецкий к записи В «Почте Mail» теперь можно оплачивать Steam, Battle.net и другие цифровые товары: “Забавно что в почтовом приложении теперь можно и игры оплачивать. Мир изменился))”

Nargis F к записи Российский прототип на базе Атом проехал 695 км на автопилоте: от Москвы до Казани: “Добрый день! В новости есть опечатка. Из заголовка следует, что поездка прошла на электромобиле Атом, однако это не так. Для…”