Для большинства пользователей важнее результат: написать текст, создать изображение, оживить сцену или озвучить персонажа.
Каталог моделей
Не обязательно разбираться в названиях моделей, чтобы начать работу. AiServise помогает выбрать инструмент по задаче, а этот каталог нужен, если вы хотите понять различия и выбрать модель осознанно.
Новые активные модели автоматически появляются здесь, а отключённые перестают показываться в каталоге.
Каталог не показывает внутренние provider-тарифы. Итоговая стоимость конкретной операции рассчитывается AiServise перед запуском.
Текстовые модели
Диалог, работа с текстом и файлами, анализ, программирование и сложные многоэтапные задачи.
DeepSeek V4 Flash
Быстрая и экономичная текстовая модель DeepSeek. Рекомендуется как модель по умолчанию для обычного чата, коротких ответов, суммаризации, простых задач, маркетинговых текстов и повседневной работы.
Подробнее о модели
Назначение
DeepSeek V4 Flash — основная быстрая текстовая модель AiServise. Она предназначена для повседневной работы, когда важны скорость ответа и умеренная стоимость.
Лучше всего подходит
- обычный диалог и ответы на вопросы;
- сокращение, переписывание и улучшение текста;
- создание описаний, объявлений и маркетинговых материалов;
- краткий анализ документов и подготовка резюме;
- генерация идей, планов и вариантов;
- простые задачи программирования.
Вход и результат
Модель принимает текстовый запрос и подготовленный сервером контекст: инструкции, роль, историю, текстовые файлы и результаты веб-поиска. Результатом является текст или код.
Ограничения
Для сложной архитектуры, глубокого анализа, длинных многоэтапных задач и критически важного кода лучше выбрать DeepSeek V4 Pro или другую премиальную модель.
DeepSeek V4 Pro
Сильная текстовая модель DeepSeek для программирования, глубокого анализа, сложных инструкций, больших контекстов и задач, где качество важнее скорости и цены.
Подробнее о модели
Назначение
DeepSeek V4 Pro — усиленная текстовая модель для сложных профессиональных задач. Её следует выбирать, когда требуется более глубокое понимание контекста и точное выполнение длинных инструкций.
Лучше всего подходит
- проектирование архитектуры и модулей;
- сложное программирование и анализ ошибок;
- большие проектные документы;
- многоэтапные инструкции;
- глубокий сравнительный анализ;
- подготовка технических решений и спецификаций.
Вход и результат
Модель получает текстовый запрос и серверный контекст AiServise. На выходе возвращает текст, структурированные данные или код.
Ограничения
Работает дороже и обычно медленнее Flash. Для коротких бытовых запросов и простого редактирования текста использование Pro не даёт заметного преимущества.
Gemini 3.1 Pro
Сильная мультимодальная reasoning-модель Google. Подходит для сложного анализа, кода, больших контекстов и работы с текстом, изображениями, видео и аудио.
Подробнее о модели
Назначение
Gemini 3.1 Pro — премиальная мультимодальная текстовая модель. Она остаётся в capability text, но может анализировать не только текст, а также изображения, видео, аудио и подготовленные файлы.
Лучше всего подходит
- совместный анализ скриншотов и исходного кода;
- разбор длинных документов и больших контекстов;
- анализ изображений, видео и аудио с текстовым ответом;
- сложные задачи программирования;
- подготовка подробных технических рекомендаций.
Вход и результат
Принимает текстовый prompt, текстовые материалы и поддерживаемые media-файлы. Возвращает текст, код или структурированный ответ.
Ограничения
Модель дорогая. Для неё действует отдельный минимальный порог доступных units. Media-вход может значительно увеличить фактический расход входных токенов.
Claude Opus 4.6
Флагманская reasoning-модель Anthropic через Replicate для сложного анализа, программирования, архитектуры, длинных задач и агентной работы.
Подробнее о модели
Назначение
Claude Opus 4.6 — премиальная текстовая модель для задач, в которых важны качество рассуждений, точность формулировок и устойчивое следование длинным инструкциям.
Лучше всего подходит
- сложная архитектура программных систем;
- анализ больших текстов и требований;
- профессиональное программирование;
- подготовка подробных документов;
- агентные и многоэтапные задачи.
Вход и результат
Получает подготовленный текстовый контекст AiServise и возвращает текст, код или структурированный результат.
Ограничения
Это дорогая модель. Для обычного чата, коротких текстов и простых преобразований лучше использовать более экономичные варианты.
GPT-5.2
Премиальная модель OpenAI для кода, сложных текстовых задач, reasoning и агентных сценариев.
Подробнее о модели
Назначение
GPT-5.2 — премиальная универсальная текстовая модель для сложных задач, программирования и многоэтапной работы с инструкциями.
Лучше всего подходит
- генерация и проверка кода;
- сложные текстовые преобразования;
- анализ требований;
- проектирование решений;
- длинные задачи с несколькими условиями.
Вход и результат
Работает с текстовым контекстом, который формирует общий request builder AiServise. Возвращает текст, код или структурированный ответ.
Ограничения
Стоимость выше базовых моделей. Для массовых коротких запросов следует выбирать DeepSeek Flash.
Анализ изображений
Модели, которые изучают изображение и возвращают текстовое описание, распознанный текст или вывод.
Qwen3 VL 8B — анализ изображений
Vision-модель. Принимает изображение и текстовый запрос, анализирует содержимое, распознаёт видимый текст и возвращает текстовый ответ.
Подробнее о модели
Назначение
Qwen3 VL 8B — отдельная vision-модель для анализа изображений. Она не генерирует изображение, а возвращает текстовое описание, распознанный текст или вывод по содержимому файла.
Лучше всего подходит
- анализу фотографий и скриншотов;
- распознаванию видимого текста;
- проверке интерфейсов и дизайна;
- описанию объектов и сцен;
- подготовке рекомендаций по изображению.
Вход и результат
Принимает одно поддерживаемое изображение и текстовый вопрос. Возвращает текст.
Ограничения
На текущем этапе основной pipeline ориентирован на одно изображение. Видео требует отдельного способа передачи media provider-у.
Создание изображений
Генерация с нуля, редактирование, работа с reference-изображениями и постоянными персонажами.
Nano Banana 2 Lite — быстро и недорого
Самая быстрая и экономичная модель семейства Nano Banana. Подходит новичкам, для черновиков, массового создания ассетов, простого редактирования и быстрых повторных генераций.
Подробнее о модели
Назначение
Nano Banana 2 Lite — стартовая и наиболее экономичная image-модель AiServise. Она предназначена для быстрых генераций и массового производства изображений без лишней стоимости.
Лучше всего подходит
- новичкам и первым генерациям;
- созданию черновых персонажей, фонов, предметов и локаций;
- проверке prompt перед запуском более дорогой модели;
- массовому созданию простых производственных ассетов;
- быстрому редактированию существующего изображения;
- сборке изображений по нескольким reference-файлам.
Вход и результат
Модель принимает текстовый prompt и до 14 reference-изображений. Поддерживает генерацию с нуля и редактирование изображения. Возвращает одно изображение примерно 1K в формате JPG или PNG.
Сильные стороны
- минимальная стоимость в линейке;
- высокая скорость;
- поддержка нескольких reference;
- удобна для повторных попыток и черновиков.
Ограничения
Разрешение ограничено уровнем 1K. Нет Search grounding. Для сложной композиции, точного текста, повышенного разрешения и финальных рекламных кадров лучше выбрать Nano Banana 2 или Nano Banana Pro.
Nano Banana 2 — баланс качества и цены
Основная универсальная image-модель. Сочетает высокое качество, скорость, хорошее следование prompt, работу с текстом, редактирование и multi-reference по разумной цене.
Подробнее о модели
Назначение
Nano Banana 2 — основная рабочая image-модель AiServise. Она занимает середину между дешёвой Lite и профессиональной Pro и подходит для большинства производственных задач.
Лучше всего подходит
- созданию качественных персонажей и локаций;
- сборке сцен из нескольких reference-изображений;
- сохранению внешности и визуального стиля;
- редактированию готовых изображений;
- изображениям с читаемым текстом;
- финальным кадрам, когда уровень Pro не требуется.
Вход и результат
Модель принимает текстовый prompt и до 14 reference-изображений. Поддерживает text-to-image, редактирование, multi-image fusion и conversational editing. Доступны разрешения 512px, 1K, 2K и 4K, а также JPG и PNG.
Сильные стороны
- хорошее соотношение качества и стоимости;
- более точное выполнение сложных инструкций, чем Lite;
- качественная работа с текстом и несколькими reference;
- подходит как основная модель ProjectProduction.
Ограничения
Стоимость зависит от выбранного разрешения. Для предельно сложных сцен, максимального контроля, профессиональной типографики и критичной стабильности нескольких персонажей следует выбрать Nano Banana Pro.
Nano Banana Pro — максимальное качество
Профессиональная image-модель Google для сложных сцен, точного текста, multi-reference, сохранения персонажей, продвинутого редактирования и финальных кадров до 4K.
Подробнее о модели
Назначение
Nano Banana Pro — профессиональная image-модель для сложных и финальных производственных изображений. Её следует выбирать, когда качество и точность важнее скорости и стоимости.
Лучше всего подходит
- сложным сценам с несколькими персонажами;
- сохранению сходства, одежды, телосложения и реквизита;
- финальным рекламным изображениям;
- постерам, упаковке, инфографике и макетам с текстом;
- точечному изменению света, камеры, глубины резкости и атмосферы;
- multi-reference сборке и профессиональному редактированию;
- изображениям повышенного разрешения до 4K.
Вход и результат
Модель принимает текстовый prompt и до 14 reference-изображений. Может сохранять сходство нескольких людей в одной композиции, создавать текст на разных языках и выполнять сложные изменения существующего изображения.
Сильные стороны
- максимальное качество линейки;
- развитое reasoning при построении сцены;
- сильная типографика;
- профессиональный контроль композиции и освещения;
- высокая устойчивость при сложной multi-reference сборке.
Ограничения
Модель заметно дороже и медленнее Lite и обычной Nano Banana 2. Даже Pro не гарантирует абсолютную идентичность персонажей и может создавать артефакты в очень сложных сценах. Фактические данные в инфографике необходимо проверять.
FLUX Schnell
Быстрая и дешёвая text-to-image модель Replicate для базовой генерации изображений и совместимости с существующим image pipeline.
Подробнее о модели
Назначение
FLUX Schnell — быстрая legacy-модель text-to-image, с которой был запущен первый рабочий image pipeline AiServise. Она сохраняется для совместимости, дешёвых тестов и уже существующих сценариев.
Лучше всего подходит
- простой генерации изображения по тексту;
- техническим проверкам image pipeline;
- дешёвым тестовым изображениям;
- совместимости со старыми запросами и настройками.
Ограничения
Модель не является основной моделью ProjectProduction. Для работы с несколькими reference, сохранения персонажей и сложного редактирования следует использовать семейство Nano Banana.
FLUX Kontext Dev — image-to-image
Специализированная image-to-image модель для редактирования и продолжения существующего изображения с сохранением его визуального контекста.
Подробнее о модели
Назначение
FLUX Kontext Dev — специализированная legacy-модель для image-to-image и сценария продолжения изображения. Она принимает исходный кадр и текстовую инструкцию изменения.
Лучше всего подходит
- точечному редактированию существующего изображения;
- продолжению сцены от выбранного reference;
- изменению деталей, композиции и атмосферы;
- совместимости с текущим Image Studio continuation flow.
Ограничения
Модель требует исходное изображение и не используется как основной text-to-image вариант ProjectProduction. Для сложной multi-reference сборки и профессиональной работы предпочтительнее Nano Banana 2 или Pro.
Создание видео
Оживление кадров, переход между сценами, движение персонажей и создание коротких видеоклипов.
Vidu Q3 Turbo
Основная быстрая модель для видео по стартовому и конечному кадрам. Рабочий режим: 720p, 5 секунд, audio=false.
Подробнее о модели
Назначение
Vidu Q3 Turbo — основной кандидат для массовой генерации коротких видеоклипов по стартовому и конечному кадрам.
Рабочий режим
- 720p;
- 5 секунд;
- native audio выключено;
- стартовый кадр обязателен;
- конечный кадр используется, когда назначен.
Wan 2.2 First/Last Frame
Экономичная модель для сравнения перехода между обязательными стартовым и конечным кадрами.
Подробнее о модели
Назначение
Wan 2.2 First/Last Frame используется как дешёвая контрольная модель интерполяции между двумя обязательными кадрами.
Рабочий режим
- стартовый и конечный кадры обязательны;
- 5 секунд;
- 8 inference steps;
- без готовой аудиодорожки.
Wan 2.7 I2V
Модель для проверки движения, морфинга, конечного кадра и синхронизации с готовой либо автоматически создаваемой аудиодорожкой.
Подробнее о модели
Назначение
Wan 2.7 I2V поддерживает стартовый и конечный кадры, готовую аудиодорожку и автоматический native audio при отсутствии входного audio.
Рабочий режим
- 720p;
- 5 секунд;
- стартовый кадр обязателен;
- конечный кадр и готовая аудиодорожка необязательны.
Kling Video 3 Pro
Эталон качества для сравнения движения, сохранения персонажей и соответствия конечному кадру. По умолчанию mode=pro и generate_audio=false.
Подробнее о модели
Назначение
Kling Video 3 Pro используется как эталон качества для контрольных клипов.
Рабочий режим
- mode=pro;
- 5 секунд;
- generate_audio=false;
- стартовый кадр обязателен;
- конечный кадр используется, когда назначен.
Wan 2.6 Image-to-Video + Audio
Создание видео по исходному изображению, постановочному prompt и необязательной готовой аудиодорожке. Поддерживает синхронизацию речи и движения губ, длительность 5–15 секунд и разрешение 720p/1080p.
Подробнее о модели
Назначение
Wan 2.6 I2V создаёт видеоклип по исходному изображению и постановочному prompt. К запросу можно прикрепить готовую WAV/MP3-аудиодорожку для синхронизации речи, мимики и движения губ.
Лучше всего подходит
- диалоговым сценам с заранее созданной репликой;
- сохранению выбранного голоса, темпа, эмоции и интонации;
- оживлению готового кадра проекта;
- коротким клипам продолжительностью 5–15 секунд;
- финальной генерации в 720p или 1080p.
Вход и результат
Обязательно принимает одно изображение и текстовый prompt движения. Аудиодорожка необязательна. Возвращает MP4-видео с частотой 24 FPS.
Ограничения
Длительность результата: 5–15 секунд. Аудио: WAV/MP3, 3–30 секунд, не более 15 МБ. Для коротких реплик менее 3 секунд потребуется отдельное дополнение дорожки тишиной перед отправкой provider-у.
Kling 1.5 Pro — Motion Brush
Видео по исходному изображению с управляемыми траекториями движения объектов. Поддерживает Motion Brush: статическую маску, динамические маски и точки траектории x/y.
Подробнее о модели
Назначение
Kling 1.5 Pro Motion Brush через fal.ai используется для управляемого image-to-video, когда пользователь не только описывает движение текстом, но и рисует траекторию конкретного объекта.
Вход
- исходное изображение обязательно;
- prompt обязателен;
- длительность 5 или 10 секунд;
- aspect ratio: 16:9, 9:16 или 1:1;
- optional tail image;
- optional static mask;
- dynamic masks с trajectories [{x,y}].
Wan 2.2 Image-to-Video 480p
Генерация короткого видео по исходному изображению и текстовому prompt. Базовый video pipeline AiServise: image-to-video, 480p, примерно 5 секунд.
Подробнее о модели
Назначение
Wan 2.2 I2V — первая рабочая video-модель AiServise. Она оживляет исходное изображение и создаёт короткий видеоклип по текстовому описанию движения.
Лучше всего подходит
- оживлению готового кадра;
- коротким тестовым клипам;
- проверке цепочки image → video;
- продолжению видео с последнего кадра;
- созданию отдельных сцен будущего ролика.
Вход и результат
Принимает одно изображение и текстовый prompt движения. Возвращает MP4-видео примерно на пять секунд в 480p.
Ограничения
Модель дорогая по сравнению с генерацией изображения. Генерация выполняется асинхронно через очередь. Продолжительность и разрешение первого pipeline ограничены.
Grok Imagine Video
Недорогая генерация видеоклипа по исходному изображению и постановочному prompt. Модель сама создаёт синхронизированные фоновые звуки и атмосферу; предназначена прежде всего для клипов без готовой реплики.
Подробнее о модели
Назначение
Grok Imagine Video создаёт короткий видеоклип по исходному изображению и локальному описанию движения. Одновременно с изображением модель сама генерирует подходящие фоновые звуки, атмосферу и простые звуковые события.
Лучше всего подходит
- клипам без заранее созданной реплики;
- быстрым рабочим пробам движения;
- немым действиям персонажей;
- переходным и атмосферным кадрам;
- итерациям, где важно быстро скорректировать движение или камеру;
- 2D, иллюстративным и реалистичным исходным кадрам.
Вход и результат
Обязательно принимает одно исходное изображение и текстовый prompt движения. Готовую аудиодорожку модель не принимает. Возвращает MP4-видео с нативно созданным синхронизированным звуком.
Prompt
Для image-to-video не нужно повторно описывать весь проект или пересказывать сюжет. Prompt должен содержать только действие текущего клипа, движение персонажей, реакцию, камеру и при необходимости желаемые звуки. Negative prompt модель не использует.
Ограничения
Длительность результата: 1–15 секунд. Разрешение: 480p или 720p. Поддерживаемые пропорции: auto, 16:9, 9:16, 1:1, 4:3, 3:4, 3:2 и 2:3.
Grok Imagine Video Extension
Продолжение готового MP4-видео по текстовому описанию следующего действия. Исходный ролик 2-15 секунд, создаваемое продолжение 2-10 секунд.
Подробнее о модели
Назначение
Grok Imagine Video Extension продолжает готовый MP4-ролик от его последнего кадра по текстовому описанию следующего действия.
Вход
- один MP4-файл;
- длительность исходного ролика 2-15 секунд;
- prompt, описывающий, что происходит дальше;
- длительность нового продолжения 2-10 секунд.
Sync 3 LipSync (fal.ai)
Внутренняя post-process модель Video Studio: готовое видео + готовая TTS-аудиодорожка → lip-sync video.
Подробнее о модели
Назначение
Внутренняя action-модель Video Studio. Не используется как visual video generator. После создания обычного немого ролика получает его вместе с точной TTS-дорожкой и выполняет lip-sync. Режим cut_off убирает лишний хвост более длинного visual-base.
Озвучка, музыка и звук
Синтез речи, голоса персонажей, музыка, атмосфера и звуковые слои проекта.
Qwen3-TTS
Многоязычная модель синтеза речи Qwen для выразительной озвучки текста. Поддерживает русский язык, встроенные голоса и управление тембром, эмоцией, темпом, тоном и интонацией через естественные инструкции. Подходит для реплик персонажей, дикторской речи, видео и аудиокниг.
Подробнее о модели
Назначение
Qwen3-TTS — многоязычная модель синтеза речи для создания выразительной озвучки текста. В AiServise она используется как один из доступных вариантов для реплик персонажей, дикторского текста и других голосовых задач.
Лучше всего подходит
- коротким и средним репликам персонажей;
- дикторскому тексту;
- озвучке видео;
- художественной речи;
- тестированию разных вариантов подачи;
- многоязычной озвучке, включая русский язык.
Вход и результат
Модель получает текст и настройки голосовой подачи. На выходе формируется готовый аудиофайл, который сохраняется в файловой системе AiServise и может использоваться в проекте.
Сильные стороны
- поддержка русского и других языков;
- несколько встроенных голосов;
- управление тембром, эмоцией, темпом, тоном и интонацией;
- подходит для разных типов персонажей и дикторской подачи.
Ограничения
Результат зависит от текста, выбранного голоса и инструкции подачи. На длинных фрагментах рекомендуется проверять произношение, ударения и стабильность выбранного характера речи.
Gemini 3.1 Flash TTS
Управляемая выразительная речь Google Gemini с выбором голоса, эмоции, темпа, интонации и произношения.
Подробнее о модели
Назначение
Основная TTS-модель для dialogue, narration и voice production assets.
Настройки
Поддерживаются выбор одного из 30 голосов, стиль, эмоция, темп, интонация, произношение и дополнительные audio tags.
MiniMax Speech 2.8 Turbo
Быстрая выразительная речь для предпросмотра, коротких реплик и массовой генерации.
Подробнее о модели
Назначение
Быстрая версия MiniMax Speech 2.8 для тестирования голосов, коротких диалогов, дикторских фрагментов и массовой генерации.
MiniMax Speech 2.8 HD
Студийная выразительная речь для финальных диалогов, диктора и аудиокниг.
Подробнее о модели
Назначение
Качественная версия MiniMax Speech 2.8 для финальных реплик, рассказчика, художественной подачи и производства аудиокниг.
TangoFlux
Быстрая генерация атмосферы, звуковых эффектов и foley по текстовому описанию.
Подробнее о модели
Назначение
TangoFlux используется в производственных карточках ambience, sound_effect и foley.
Вход
Модель принимает текстовый prompt и параметры длительности, количества шагов и силы следования описанию.
Результат
Провайдер возвращает WAV-аудио с частотой 44,1 кГц. После сохранения файл проходит существующую FFmpeg-нормализацию AiServise в MP3 44,1 кГц stereo 128k.
Ограничения
Максимальная длительность одного результата — 30 секунд. Для коротких одиночных эффектов рекомендуется 3–5 секунд.
MiniMax Music 2.6
Генерация инструментальной музыки или песни по текстовому описанию.
Подробнее о модели
Назначение
Создание музыкального слоя проекта. Для видеопроизводства по умолчанию используется инструментальный режим без вокала.
Начните с задачи, а не с названия модели
Для обычной работы откройте AI-чат или нужную возможность. Выбор конкретной модели можно сделать уже внутри рабочего интерфейса.