AiServise.ru
AI-модели AiServise

Каталог моделей

Не обязательно разбираться в названиях моделей, чтобы начать работу. AiServise помогает выбрать инструмент по задаче, а этот каталог нужен, если вы хотите понять различия и выбрать модель осознанно.

27 активных моделей Каталог формируется автоматически из AiServise
Выбирайте по задаче

Для большинства пользователей важнее результат: написать текст, создать изображение, оживить сцену или озвучить персонажа.

Модели могут меняться

Новые активные модели автоматически появляются здесь, а отключённые перестают показываться в каталоге.

Стоимость считается системой

Каталог не показывает внутренние provider-тарифы. Итоговая стоимость конкретной операции рассчитывается AiServise перед запуском.

5 моделей

Текстовые модели

Диалог, работа с текстом и файлами, анализ, программирование и сложные многоэтапные задачи.

Текстовые модели

DeepSeek V4 Flash

Быстрая и экономичная текстовая модель DeepSeek. Рекомендуется как модель по умолчанию для обычного чата, коротких ответов, суммаризации, простых задач, маркетинговых текстов и повседневной работы.

Контекст 128,000 токенов Ответ до 8,000 токенов
Подробнее о модели

Назначение

DeepSeek V4 Flash — основная быстрая текстовая модель AiServise. Она предназначена для повседневной работы, когда важны скорость ответа и умеренная стоимость.

Лучше всего подходит

  • обычный диалог и ответы на вопросы;
  • сокращение, переписывание и улучшение текста;
  • создание описаний, объявлений и маркетинговых материалов;
  • краткий анализ документов и подготовка резюме;
  • генерация идей, планов и вариантов;
  • простые задачи программирования.

Вход и результат

Модель принимает текстовый запрос и подготовленный сервером контекст: инструкции, роль, историю, текстовые файлы и результаты веб-поиска. Результатом является текст или код.

Ограничения

Для сложной архитектуры, глубокого анализа, длинных многоэтапных задач и критически важного кода лучше выбрать DeepSeek V4 Pro или другую премиальную модель.

Текстовые модели

DeepSeek V4 Pro

Сильная текстовая модель DeepSeek для программирования, глубокого анализа, сложных инструкций, больших контекстов и задач, где качество важнее скорости и цены.

Контекст 128,000 токенов Ответ до 12,000 токенов
Подробнее о модели

Назначение

DeepSeek V4 Pro — усиленная текстовая модель для сложных профессиональных задач. Её следует выбирать, когда требуется более глубокое понимание контекста и точное выполнение длинных инструкций.

Лучше всего подходит

  • проектирование архитектуры и модулей;
  • сложное программирование и анализ ошибок;
  • большие проектные документы;
  • многоэтапные инструкции;
  • глубокий сравнительный анализ;
  • подготовка технических решений и спецификаций.

Вход и результат

Модель получает текстовый запрос и серверный контекст AiServise. На выходе возвращает текст, структурированные данные или код.

Ограничения

Работает дороже и обычно медленнее Flash. Для коротких бытовых запросов и простого редактирования текста использование Pro не даёт заметного преимущества.

Текстовые модели

Gemini 3.1 Pro

Сильная мультимодальная reasoning-модель Google. Подходит для сложного анализа, кода, больших контекстов и работы с текстом, изображениями, видео и аудио.

Контекст 1,000,000 токенов Ответ до 8,192 токенов
Подробнее о модели

Назначение

Gemini 3.1 Pro — премиальная мультимодальная текстовая модель. Она остаётся в capability text, но может анализировать не только текст, а также изображения, видео, аудио и подготовленные файлы.

Лучше всего подходит

  • совместный анализ скриншотов и исходного кода;
  • разбор длинных документов и больших контекстов;
  • анализ изображений, видео и аудио с текстовым ответом;
  • сложные задачи программирования;
  • подготовка подробных технических рекомендаций.

Вход и результат

Принимает текстовый prompt, текстовые материалы и поддерживаемые media-файлы. Возвращает текст, код или структурированный ответ.

Ограничения

Модель дорогая. Для неё действует отдельный минимальный порог доступных units. Media-вход может значительно увеличить фактический расход входных токенов.

Текстовые модели

Claude Opus 4.6

Флагманская reasoning-модель Anthropic через Replicate для сложного анализа, программирования, архитектуры, длинных задач и агентной работы.

Контекст 200,000 токенов Ответ до 4,096 токенов
Подробнее о модели

Назначение

Claude Opus 4.6 — премиальная текстовая модель для задач, в которых важны качество рассуждений, точность формулировок и устойчивое следование длинным инструкциям.

Лучше всего подходит

  • сложная архитектура программных систем;
  • анализ больших текстов и требований;
  • профессиональное программирование;
  • подготовка подробных документов;
  • агентные и многоэтапные задачи.

Вход и результат

Получает подготовленный текстовый контекст AiServise и возвращает текст, код или структурированный результат.

Ограничения

Это дорогая модель. Для обычного чата, коротких текстов и простых преобразований лучше использовать более экономичные варианты.

Текстовые модели

GPT-5.2

Премиальная модель OpenAI для кода, сложных текстовых задач, reasoning и агентных сценариев.

Контекст 200,000 токенов Ответ до 4,096 токенов
Подробнее о модели

Назначение

GPT-5.2 — премиальная универсальная текстовая модель для сложных задач, программирования и многоэтапной работы с инструкциями.

Лучше всего подходит

  • генерация и проверка кода;
  • сложные текстовые преобразования;
  • анализ требований;
  • проектирование решений;
  • длинные задачи с несколькими условиями.

Вход и результат

Работает с текстовым контекстом, который формирует общий request builder AiServise. Возвращает текст, код или структурированный ответ.

Ограничения

Стоимость выше базовых моделей. Для массовых коротких запросов следует выбирать DeepSeek Flash.

1 моделей

Анализ изображений

Модели, которые изучают изображение и возвращают текстовое описание, распознанный текст или вывод.

Анализ изображений

Qwen3 VL 8B — анализ изображений

Vision-модель. Принимает изображение и текстовый запрос, анализирует содержимое, распознаёт видимый текст и возвращает текстовый ответ.

Подробнее о модели

Назначение

Qwen3 VL 8B — отдельная vision-модель для анализа изображений. Она не генерирует изображение, а возвращает текстовое описание, распознанный текст или вывод по содержимому файла.

Лучше всего подходит

  • анализу фотографий и скриншотов;
  • распознаванию видимого текста;
  • проверке интерфейсов и дизайна;
  • описанию объектов и сцен;
  • подготовке рекомендаций по изображению.

Вход и результат

Принимает одно поддерживаемое изображение и текстовый вопрос. Возвращает текст.

Ограничения

На текущем этапе основной pipeline ориентирован на одно изображение. Видео требует отдельного способа передачи media provider-у.

5 моделей

Создание изображений

Генерация с нуля, редактирование, работа с reference-изображениями и постоянными персонажами.

Создание изображений

Nano Banana 2 Lite — быстро и недорого

Самая быстрая и экономичная модель семейства Nano Banana. Подходит новичкам, для черновиков, массового создания ассетов, простого редактирования и быстрых повторных генераций.

Подробнее о модели

Назначение

Nano Banana 2 Lite — стартовая и наиболее экономичная image-модель AiServise. Она предназначена для быстрых генераций и массового производства изображений без лишней стоимости.

Лучше всего подходит

  • новичкам и первым генерациям;
  • созданию черновых персонажей, фонов, предметов и локаций;
  • проверке prompt перед запуском более дорогой модели;
  • массовому созданию простых производственных ассетов;
  • быстрому редактированию существующего изображения;
  • сборке изображений по нескольким reference-файлам.

Вход и результат

Модель принимает текстовый prompt и до 14 reference-изображений. Поддерживает генерацию с нуля и редактирование изображения. Возвращает одно изображение примерно 1K в формате JPG или PNG.

Сильные стороны

  • минимальная стоимость в линейке;
  • высокая скорость;
  • поддержка нескольких reference;
  • удобна для повторных попыток и черновиков.

Ограничения

Разрешение ограничено уровнем 1K. Нет Search grounding. Для сложной композиции, точного текста, повышенного разрешения и финальных рекламных кадров лучше выбрать Nano Banana 2 или Nano Banana Pro.

Создание изображений

Nano Banana 2 — баланс качества и цены

Основная универсальная image-модель. Сочетает высокое качество, скорость, хорошее следование prompt, работу с текстом, редактирование и multi-reference по разумной цене.

Подробнее о модели

Назначение

Nano Banana 2 — основная рабочая image-модель AiServise. Она занимает середину между дешёвой Lite и профессиональной Pro и подходит для большинства производственных задач.

Лучше всего подходит

  • созданию качественных персонажей и локаций;
  • сборке сцен из нескольких reference-изображений;
  • сохранению внешности и визуального стиля;
  • редактированию готовых изображений;
  • изображениям с читаемым текстом;
  • финальным кадрам, когда уровень Pro не требуется.

Вход и результат

Модель принимает текстовый prompt и до 14 reference-изображений. Поддерживает text-to-image, редактирование, multi-image fusion и conversational editing. Доступны разрешения 512px, 1K, 2K и 4K, а также JPG и PNG.

Сильные стороны

  • хорошее соотношение качества и стоимости;
  • более точное выполнение сложных инструкций, чем Lite;
  • качественная работа с текстом и несколькими reference;
  • подходит как основная модель ProjectProduction.

Ограничения

Стоимость зависит от выбранного разрешения. Для предельно сложных сцен, максимального контроля, профессиональной типографики и критичной стабильности нескольких персонажей следует выбрать Nano Banana Pro.

Создание изображений

Nano Banana Pro — максимальное качество

Профессиональная image-модель Google для сложных сцен, точного текста, multi-reference, сохранения персонажей, продвинутого редактирования и финальных кадров до 4K.

Подробнее о модели

Назначение

Nano Banana Pro — профессиональная image-модель для сложных и финальных производственных изображений. Её следует выбирать, когда качество и точность важнее скорости и стоимости.

Лучше всего подходит

  • сложным сценам с несколькими персонажами;
  • сохранению сходства, одежды, телосложения и реквизита;
  • финальным рекламным изображениям;
  • постерам, упаковке, инфографике и макетам с текстом;
  • точечному изменению света, камеры, глубины резкости и атмосферы;
  • multi-reference сборке и профессиональному редактированию;
  • изображениям повышенного разрешения до 4K.

Вход и результат

Модель принимает текстовый prompt и до 14 reference-изображений. Может сохранять сходство нескольких людей в одной композиции, создавать текст на разных языках и выполнять сложные изменения существующего изображения.

Сильные стороны

  • максимальное качество линейки;
  • развитое reasoning при построении сцены;
  • сильная типографика;
  • профессиональный контроль композиции и освещения;
  • высокая устойчивость при сложной multi-reference сборке.

Ограничения

Модель заметно дороже и медленнее Lite и обычной Nano Banana 2. Даже Pro не гарантирует абсолютную идентичность персонажей и может создавать артефакты в очень сложных сценах. Фактические данные в инфографике необходимо проверять.

Создание изображений

FLUX Schnell

Быстрая и дешёвая text-to-image модель Replicate для базовой генерации изображений и совместимости с существующим image pipeline.

Подробнее о модели

Назначение

FLUX Schnell — быстрая legacy-модель text-to-image, с которой был запущен первый рабочий image pipeline AiServise. Она сохраняется для совместимости, дешёвых тестов и уже существующих сценариев.

Лучше всего подходит

  • простой генерации изображения по тексту;
  • техническим проверкам image pipeline;
  • дешёвым тестовым изображениям;
  • совместимости со старыми запросами и настройками.

Ограничения

Модель не является основной моделью ProjectProduction. Для работы с несколькими reference, сохранения персонажей и сложного редактирования следует использовать семейство Nano Banana.

Создание изображений

FLUX Kontext Dev — image-to-image

Специализированная image-to-image модель для редактирования и продолжения существующего изображения с сохранением его визуального контекста.

Подробнее о модели

Назначение

FLUX Kontext Dev — специализированная legacy-модель для image-to-image и сценария продолжения изображения. Она принимает исходный кадр и текстовую инструкцию изменения.

Лучше всего подходит

  • точечному редактированию существующего изображения;
  • продолжению сцены от выбранного reference;
  • изменению деталей, композиции и атмосферы;
  • совместимости с текущим Image Studio continuation flow.

Ограничения

Модель требует исходное изображение и не используется как основной text-to-image вариант ProjectProduction. Для сложной multi-reference сборки и профессиональной работы предпочтительнее Nano Banana 2 или Pro.

10 моделей

Создание видео

Оживление кадров, переход между сценами, движение персонажей и создание коротких видеоклипов.

Создание видео

Vidu Q3 Turbo

Основная быстрая модель для видео по стартовому и конечному кадрам. Рабочий режим: 720p, 5 секунд, audio=false.

Подробнее о модели

Назначение

Vidu Q3 Turbo — основной кандидат для массовой генерации коротких видеоклипов по стартовому и конечному кадрам.

Рабочий режим

  • 720p;
  • 5 секунд;
  • native audio выключено;
  • стартовый кадр обязателен;
  • конечный кадр используется, когда назначен.
Создание видео

Wan 2.2 First/Last Frame

Экономичная модель для сравнения перехода между обязательными стартовым и конечным кадрами.

Подробнее о модели

Назначение

Wan 2.2 First/Last Frame используется как дешёвая контрольная модель интерполяции между двумя обязательными кадрами.

Рабочий режим

  • стартовый и конечный кадры обязательны;
  • 5 секунд;
  • 8 inference steps;
  • без готовой аудиодорожки.
Создание видео

Wan 2.7 I2V

Модель для проверки движения, морфинга, конечного кадра и синхронизации с готовой либо автоматически создаваемой аудиодорожкой.

Подробнее о модели

Назначение

Wan 2.7 I2V поддерживает стартовый и конечный кадры, готовую аудиодорожку и автоматический native audio при отсутствии входного audio.

Рабочий режим

  • 720p;
  • 5 секунд;
  • стартовый кадр обязателен;
  • конечный кадр и готовая аудиодорожка необязательны.
Создание видео

Kling Video 3 Pro

Эталон качества для сравнения движения, сохранения персонажей и соответствия конечному кадру. По умолчанию mode=pro и generate_audio=false.

Подробнее о модели

Назначение

Kling Video 3 Pro используется как эталон качества для контрольных клипов.

Рабочий режим

  • mode=pro;
  • 5 секунд;
  • generate_audio=false;
  • стартовый кадр обязателен;
  • конечный кадр используется, когда назначен.
Создание видео

Wan 2.6 Image-to-Video + Audio

Создание видео по исходному изображению, постановочному prompt и необязательной готовой аудиодорожке. Поддерживает синхронизацию речи и движения губ, длительность 5–15 секунд и разрешение 720p/1080p.

Подробнее о модели

Назначение

Wan 2.6 I2V создаёт видеоклип по исходному изображению и постановочному prompt. К запросу можно прикрепить готовую WAV/MP3-аудиодорожку для синхронизации речи, мимики и движения губ.

Лучше всего подходит

  • диалоговым сценам с заранее созданной репликой;
  • сохранению выбранного голоса, темпа, эмоции и интонации;
  • оживлению готового кадра проекта;
  • коротким клипам продолжительностью 5–15 секунд;
  • финальной генерации в 720p или 1080p.

Вход и результат

Обязательно принимает одно изображение и текстовый prompt движения. Аудиодорожка необязательна. Возвращает MP4-видео с частотой 24 FPS.

Ограничения

Длительность результата: 5–15 секунд. Аудио: WAV/MP3, 3–30 секунд, не более 15 МБ. Для коротких реплик менее 3 секунд потребуется отдельное дополнение дорожки тишиной перед отправкой provider-у.

Создание видео

Kling 1.5 Pro — Motion Brush

Видео по исходному изображению с управляемыми траекториями движения объектов. Поддерживает Motion Brush: статическую маску, динамические маски и точки траектории x/y.

Подробнее о модели

Назначение

Kling 1.5 Pro Motion Brush через fal.ai используется для управляемого image-to-video, когда пользователь не только описывает движение текстом, но и рисует траекторию конкретного объекта.

Вход

  • исходное изображение обязательно;
  • prompt обязателен;
  • длительность 5 или 10 секунд;
  • aspect ratio: 16:9, 9:16 или 1:1;
  • optional tail image;
  • optional static mask;
  • dynamic masks с trajectories [{x,y}].
Создание видео

Wan 2.2 Image-to-Video 480p

Генерация короткого видео по исходному изображению и текстовому prompt. Базовый video pipeline AiServise: image-to-video, 480p, примерно 5 секунд.

Подробнее о модели

Назначение

Wan 2.2 I2V — первая рабочая video-модель AiServise. Она оживляет исходное изображение и создаёт короткий видеоклип по текстовому описанию движения.

Лучше всего подходит

  • оживлению готового кадра;
  • коротким тестовым клипам;
  • проверке цепочки image → video;
  • продолжению видео с последнего кадра;
  • созданию отдельных сцен будущего ролика.

Вход и результат

Принимает одно изображение и текстовый prompt движения. Возвращает MP4-видео примерно на пять секунд в 480p.

Ограничения

Модель дорогая по сравнению с генерацией изображения. Генерация выполняется асинхронно через очередь. Продолжительность и разрешение первого pipeline ограничены.

Создание видео

Grok Imagine Video

Недорогая генерация видеоклипа по исходному изображению и постановочному prompt. Модель сама создаёт синхронизированные фоновые звуки и атмосферу; предназначена прежде всего для клипов без готовой реплики.

Подробнее о модели

Назначение

Grok Imagine Video создаёт короткий видеоклип по исходному изображению и локальному описанию движения. Одновременно с изображением модель сама генерирует подходящие фоновые звуки, атмосферу и простые звуковые события.

Лучше всего подходит

  • клипам без заранее созданной реплики;
  • быстрым рабочим пробам движения;
  • немым действиям персонажей;
  • переходным и атмосферным кадрам;
  • итерациям, где важно быстро скорректировать движение или камеру;
  • 2D, иллюстративным и реалистичным исходным кадрам.

Вход и результат

Обязательно принимает одно исходное изображение и текстовый prompt движения. Готовую аудиодорожку модель не принимает. Возвращает MP4-видео с нативно созданным синхронизированным звуком.

Prompt

Для image-to-video не нужно повторно описывать весь проект или пересказывать сюжет. Prompt должен содержать только действие текущего клипа, движение персонажей, реакцию, камеру и при необходимости желаемые звуки. Negative prompt модель не использует.

Ограничения

Длительность результата: 1–15 секунд. Разрешение: 480p или 720p. Поддерживаемые пропорции: auto, 16:9, 9:16, 1:1, 4:3, 3:4, 3:2 и 2:3.

Создание видео

Grok Imagine Video Extension

Продолжение готового MP4-видео по текстовому описанию следующего действия. Исходный ролик 2-15 секунд, создаваемое продолжение 2-10 секунд.

Подробнее о модели

Назначение

Grok Imagine Video Extension продолжает готовый MP4-ролик от его последнего кадра по текстовому описанию следующего действия.

Вход

  • один MP4-файл;
  • длительность исходного ролика 2-15 секунд;
  • prompt, описывающий, что происходит дальше;
  • длительность нового продолжения 2-10 секунд.
Создание видео

Sync 3 LipSync (fal.ai)

Внутренняя post-process модель Video Studio: готовое видео + готовая TTS-аудиодорожка → lip-sync video.

Подробнее о модели

Назначение

Внутренняя action-модель Video Studio. Не используется как visual video generator. После создания обычного немого ролика получает его вместе с точной TTS-дорожкой и выполняет lip-sync. Режим cut_off убирает лишний хвост более длинного visual-base.

6 моделей

Озвучка, музыка и звук

Синтез речи, голоса персонажей, музыка, атмосфера и звуковые слои проекта.

Озвучка, музыка и звук

Qwen3-TTS

Многоязычная модель синтеза речи Qwen для выразительной озвучки текста. Поддерживает русский язык, встроенные голоса и управление тембром, эмоцией, темпом, тоном и интонацией через естественные инструкции. Подходит для реплик персонажей, дикторской речи, видео и аудиокниг.

Подробнее о модели

Назначение

Qwen3-TTS — многоязычная модель синтеза речи для создания выразительной озвучки текста. В AiServise она используется как один из доступных вариантов для реплик персонажей, дикторского текста и других голосовых задач.

Лучше всего подходит

  • коротким и средним репликам персонажей;
  • дикторскому тексту;
  • озвучке видео;
  • художественной речи;
  • тестированию разных вариантов подачи;
  • многоязычной озвучке, включая русский язык.

Вход и результат

Модель получает текст и настройки голосовой подачи. На выходе формируется готовый аудиофайл, который сохраняется в файловой системе AiServise и может использоваться в проекте.

Сильные стороны

  • поддержка русского и других языков;
  • несколько встроенных голосов;
  • управление тембром, эмоцией, темпом, тоном и интонацией;
  • подходит для разных типов персонажей и дикторской подачи.

Ограничения

Результат зависит от текста, выбранного голоса и инструкции подачи. На длинных фрагментах рекомендуется проверять произношение, ударения и стабильность выбранного характера речи.

Озвучка, музыка и звук

Gemini 3.1 Flash TTS

Управляемая выразительная речь Google Gemini с выбором голоса, эмоции, темпа, интонации и произношения.

Подробнее о модели

Назначение

Основная TTS-модель для dialogue, narration и voice production assets.

Настройки

Поддерживаются выбор одного из 30 голосов, стиль, эмоция, темп, интонация, произношение и дополнительные audio tags.

Озвучка, музыка и звук

MiniMax Speech 2.8 Turbo

Быстрая выразительная речь для предпросмотра, коротких реплик и массовой генерации.

Подробнее о модели

Назначение

Быстрая версия MiniMax Speech 2.8 для тестирования голосов, коротких диалогов, дикторских фрагментов и массовой генерации.

Озвучка, музыка и звук

MiniMax Speech 2.8 HD

Студийная выразительная речь для финальных диалогов, диктора и аудиокниг.

Подробнее о модели

Назначение

Качественная версия MiniMax Speech 2.8 для финальных реплик, рассказчика, художественной подачи и производства аудиокниг.

Озвучка, музыка и звук

TangoFlux

Быстрая генерация атмосферы, звуковых эффектов и foley по текстовому описанию.

Подробнее о модели

Назначение

TangoFlux используется в производственных карточках ambience, sound_effect и foley.

Вход

Модель принимает текстовый prompt и параметры длительности, количества шагов и силы следования описанию.

Результат

Провайдер возвращает WAV-аудио с частотой 44,1 кГц. После сохранения файл проходит существующую FFmpeg-нормализацию AiServise в MP3 44,1 кГц stereo 128k.

Ограничения

Максимальная длительность одного результата — 30 секунд. Для коротких одиночных эффектов рекомендуется 3–5 секунд.

Озвучка, музыка и звук

MiniMax Music 2.6

Генерация инструментальной музыки или песни по текстовому описанию.

Подробнее о модели

Назначение

Создание музыкального слоя проекта. Для видеопроизводства по умолчанию используется инструментальный режим без вокала.

Не знаете, что выбрать?

Начните с задачи, а не с названия модели

Для обычной работы откройте AI-чат или нужную возможность. Выбор конкретной модели можно сделать уже внутри рабочего интерфейса.