DeepSeek выпустила мультимодальную модель — говорит, не хуже Claude
DeepSeek представила экспериментальную V4-Flash-Vision-Exp — новую версию своей модели с поддержкой визуального контента. Пока она доступна только разработчикам через API и не появилась в обычном чат-боте компании.
DeepSeek представила экспериментальную V4-Flash-Vision-Exp — новую версию своей модели с поддержкой визуального контента. Пока она доступна только разработчикам через API и не появилась в обычном чат-боте компании.
V4-Flash-Vision-Exp может принимать текст и изображения в одном запросе. Модель умеет анализировать фотографии и скриншоты, разбираться в графиках, распознавать расположение элементов интерфейса и использовать визуальную информацию при выполнении более сложных агентных задач.
При этом DeepSeek утверждает, что добавление «зрения» не ухудшило работу модели с текстом: по таким задачам новая версия соответствует обычной V4 Flash.
В тестах мультимодальных агентов V4-Flash-Vision-Exp показала более высокие результаты, чем базовая V4 Flash, и приблизилась к Claude Opus 4.8 от Anthropic. В некоторых отдельных бенчмарках модель DeepSeek смогла ее обойти. При этом речь идет о результатах тестирования, опубликованных самой компанией.
Модель предназначена не только для обычного распознавания изображений. Например, агент на ее основе может посмотреть на скриншот интерфейса, понять расположение элементов и использовать эту информацию вместе с другими инструментами для выполнения задачи.
DeepSeek также сохранила тарифы V4 Flash. В пиковые часы стоимость составляет от $0,014 до $0,44 за 1 миллион входных токенов в зависимости от типа данных и $1,32 за 1 миллион выходных. В непиковые часы цены снижаются до $0,007–0,22 и $0,66 соответственно.
Изображения при этом переводятся в токены: одна картинка учитывается как максимум 384 токена. Это позволяет заранее оценить стоимость обработки визуального контента. Пока V4-Flash-Vision-Exp имеет статус экспериментальной модели. DeepSeek не сообщила, когда ее возможности появятся в основном чат-боте или войдут в стабильную версию V4.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.