Get Started

Models

All AI models supported by Vivgrid — including GPT-5, Claude Opus/Sonnet, Gemini, and DeepSeek variants for coding, text, speech, and multimodal workloads.

Vivgrid provides access to a range of powerful AI models for building enterprise-grade AI agents. We select models based on their performance, cost-effectiveness, and suitability for various tasks. Pricing is transparent and, for most models, matches the rates of the original providers.

Supported Models

Coding Models

Agent Models

Image Models

Decision Models

How to Set Models for your Agent Project

You don't need to specify a model-name in your API calls. The model for your agent is managed on the backend, so switching models won't require any code changes.

To change the model for your agent, go to the Agent Settings page in the Vivgrid Console.

Pricing

Pricing is calculated in USD per 1 million tokens. The table below details the cost for input, cached, and output tokens for each model.

Image generation models bill generated images as output tokens at their own rate; the gpt-image-2.5 models also price image inputs separately from text. See gemini-3-pro-image and gemini-3.1-flash-image for the per-image token conversion at each resolution.

ModelInput TokenCached TokenOutput Token
viv-fast New$0.13$0.05$0.40
jev-latest New$0.084-$0.00
gpt-image-2.5-flare$8.00 (text)
$8.00 (image)
$1.25 (text)
$3.00 (image)
$0.00 (text)
$33.00 (image)
gpt-image-2.5-sunburst$8.00 (text)
$8.00 (image)
$1.25 (text)
$3.00 (image)
$0.00 (text)
$33.00 (image)
gpt-6-astra New$10.00 (<= 272k tokens)
$20.00 (> 272k tokens)
$1.00 (<= 272k tokens)
$2.00 (> 272k tokens)
$50.00 (<= 272k tokens)
$75.00 (> 272k tokens)
claude-fable-5-1 New$10.00$0.50$50.00
gemini-3.8-flash$0.75$0.15$3.75
kimi-k2.8-preview$1.00$0.26$4.15
deepseek-v4.1-flash New$0.31$0.01$1.23
claude-fable-5$10.00$1.25$50.00
glm-5.3-flash$0.15$0.04$0.50
deepseek-v4-pro-0813$1.35$0.05$3.00
deepseek-v4-flash-vision-exp$0.44$0.044$1.32
deepseek-v4-flash (0731)$0.44$0.044$1.32
gemini-3.7-flash$0.75$0.075$3.75
glm-5.3$1.20$0.30$4.20
gemini-3.6-flash$0.75$0.075$3.75
gemini-3-pro-image$2.00$0.20$12.00 (text)
$120.00 (image)
gemini-3.1-flash-image$0.50$0.05$3.00 (text)
$60.00 (image)
claude-opus-5$5.00$0.50$25.00
kimi-k3$3.00$0.30$15.00
gpt-5.6-sol$5.00 (<= 272k tokens)
$10.00 (> 272k tokens)
$0.50 (<= 272k tokens)
$1.00 (> 272k tokens)
$30.00 (<= 272k tokens)
$45.00 (> 272k tokens)
gpt-5.6-terra$2.50 (<= 272k tokens)
$5.00 (> 272k tokens)
$0.25 (<= 272k tokens)
$0.50 (> 272k tokens)
$15.00 (<= 272k tokens)
$22.50 (> 272k tokens)
gpt-5.6-luna$1.00 (<= 272k tokens)
$2.00 (> 272k tokens)
$0.10 (<= 272k tokens)
$0.20 (> 272k tokens)
$6.00 (<= 272k tokens)
$9.00 (> 272k tokens)
claude-sonnet-5$2.00$0.20$10.00
claude-opus-4.8$5.00$0.50$25.00
glm-5.2$1.20$0.30$4.20
minimax-m3$0.32 (<= 512k tokens)
$0.67 (> 512k tokens)
$0.07 (<= 512k tokens)
$0.13 (> 512k tokens)
$1.28 (<= 512k tokens)
$2.55 (> 512k tokens)
gemini-3.5-flash$1.50$0.15$9.00
kimi-k2.6$1.00$0.20$4.10
glm-5.1$0.91 (<= 32k tokens)
$1.22 (> 32k tokens)
$0.20 (<= 32k tokens)
$0.31 (> 32k tokens)
$3.64 (<= 32k tokens)
$4.25 (> 32k tokens)
minimax-m2.7$0.32$0.07$1.28
deepseek-v4-pro$1.80$0.30$3.50
gpt-5.5$5.00 (<= 272k tokens)
$10.00 (> 272k tokens)
$0.50 (<= 272k tokens)
$1.00 (> 272k tokens)
$30.00 (<= 272k tokens)
$45.00 (> 272k tokens)
gpt-5.4$2.50 (<= 272k tokens)
$5.00 (> 272k tokens)
$0.25 (<= 272k tokens)
$0.50 (> 272k tokens)
$15.00 (<= 272k tokens)
$22.50 (> 272k tokens)
gpt-5.4-mini$0.75$0.075$4.50
gpt-5.4-nano$0.20$0.02$1.25
gemini-3.1-flash-lite-preview$0.25$0.025$1.50
gemini-3.1-pro-preview$2.00 (<= 200k tokens)
$4.00 (> 200k tokens)
$0.20 (<= 200k tokens)
$0.40 (> 200k tokens)
$12.00 (<= 200k tokens)
$18.00 (> 200k tokens)
claude-opus-4.7$5.00$0.50$25.00
claude-opus-4.6$5.00$0.50$25.00
claude-sonnet-4.6$3.00$0.30$15.00
claude-haiku-4.5$1.00$0.10$5.00
gpt-5.3-codex$1.75$0.18$14.00
gpt-5.2-codex$1.75$0.18$14.00
gpt-5.1-codex-max$1.25$0.13$10.00
gpt-5.1-codex$1.25$0.13$10.00
gpt-5.2$1.75$0.18$14.00
gpt-5.1$1.25$0.125$10.00
gpt-5$1.25$0.125$10.00
gpt-5-mini$0.25$0.03$2.00
gpt-5.1$1.25$0.125$10.00
gemini-3-pro-preview$2.00$0.40$12.00
gemini-3-flash-preview$0.50$0.05$3.00
gemini-2.5-pro$1.25 (<= 200k tokens)
$2.50 (> 200k tokens)
$0.125 (<= 200k tokens)
$0.25 (> 200k tokens)
$10.00 (<= 200k tokens)
$15.00 (> 200k tokens)
gemini-2.5-flash$0.30$0.03$2.50
deepseek-v3.2$0.30$0.06$0.45
kimi-k2.5$1.25$0.125$10.00
glm-5$1.00$0.10$3.20
gpt-4.1$2.00$0.50$8.00
gpt-4o$2.50$1.25$10.00
deepseek-r1$1.35-$5.40
deepseek-v3.1$1.14-$4.56

Capabilities

ModelContext WindowMax Output TokensTool Call
viv-fast New1,000,000256,000Yes
jev-latest New64,000No
gpt-6-astra New1,050,000128,000Yes
claude-fable-5-1 New1,000,000128,000Yes
gemini-3.8-flash1,000,000128,000Yes
kimi-k2.8-preview1,000,000Yes
deepseek-v4.1-flash New1,000,000384,000Yes
gpt-image-2.5-flareNo
gpt-image-2.5-sunburstNo
claude-fable-51,000,000128,000Yes
glm-5.3-flash1,000,000384,000Yes
deepseek-v4-pro-08131,000,000384,000Yes
deepseek-v4-flash-vision-exp1,000,000384,000Yes
deepseek-v4-flash (0731)1,000,000384,000Yes
gemini-3.7-flash1,000,00064,000Yes
glm-5.31,000,000128,000Yes
gemini-3.6-flash1,000,00064,000Yes
gemini-3-pro-image65,53632,768No
gemini-3.1-flash-image131,07232,768No
claude-opus-51,000,000128,000Yes
kimi-k31,000,000128,000Yes
gpt-5.6-sol1,050,000128,000Yes
gpt-5.6-terra1,050,000128,000Yes
gpt-5.6-luna1,050,000128,000Yes
claude-sonnet-51,000,000128,000Yes
claude-opus-4.81,000,000128,000Yes
glm-5.21,000,000128,000Yes
minimax-m3512,000128,000Yes
gemini-3.5-flash1,000,00065,536Yes
kimi-k2.6256,000256,000Yes
glm-5.1200,000128,000Yes
minimax-m2.7204,800131,072Yes
deepseek-v4-pro1,000,000384,000Yes
gpt-5.51,050,000128,000Yes
gpt-5.41,050,000128,000Yes
gpt-5.4-mini400,000128,000Yes
gpt-5.4-nano400,000128,000Yes
gemini-3.1-flash-lite-preview1,048,57665,536Yes
gemini-3.1-pro-preview1,048,57665,536Yes
claude-opus-4.71,000,000128,000Yes
claude-opus-4.6200,000128,000Yes
claude-sonnet-4.6200,000128,000Yes
gpt-5.3-codex400,000128,000Yes
gpt-5.2-codex400,000128,000Yes
gpt-5.1-codex-max400,000128,000Yes
gpt-5.1-codex400,000128,000Yes
gpt-5.2400,000128,000Yes
gpt-5.1400,000128,000Yes
gpt-5400,000128,000Yes
gpt-5-mini272,000128,000Yes
deepseek-v3.2128,000128,000Yes
gemini-3-pro-preview1,000,00064,000Yes
gemini-3-flash-preview1,000,00064,000Yes

Service Regions & Geo-Distributed Acceleration

Vivgrid intelligently accelerates model inference by automatically routing API requests to the nearest available compute region, minimizing latency and maximizing throughput — all while maintaining data-residency compliance for enterprise workloads.

Unlike conventional Global deployments on public clouds (which rely on single centralized endpoints), Vivgrid’s geo-distributed architecture continuously synchronizes AI Skills and model states across multiple data zones, ensuring each region delivers optimized, low-latency performance.

ModelAcceleration ModeAccelerated Regions
viv-fast New⚡ Geo-DistributedAMER, EMEA, APAC
jev-latest New🌐 Global (Centralized)AMER
gpt-6-astra New⚡ Geo-DistributedAMER, EMEA, APAC
claude-fable-5-1 New⚡ Geo-DistributedAMER, EMEA, APAC
gpt-image-2.5-flare🌐 Global (Centralized)EMEA
gpt-image-2.5-sunburst🌐 Global (Centralized)EMEA
gemini-3.8-flash🌐 Global (Centralized)
kimi-k2.8-preview🌐 Global (Centralized)APAC
deepseek-v4.1-flash New🌐 Global (Centralized)APAC
claude-fable-5⚡ Geo-DistributedAMER, EMEA, APAC
glm-5.3-flash🌐 Global (Centralized)APAC
deepseek-v4-pro-0813🌐 Global (Centralized)APAC
deepseek-v4-flash-vision-exp🌐 Global (Centralized)APAC
deepseek-v4-flash (0731)🌐 Global (Centralized)APAC
gemini-3.7-flash🌐 Global (Centralized)
glm-5.3🌐 Global (Centralized)APAC
gemini-3.6-flash🌐 Global (Centralized)
gemini-3-pro-image🌐 Global (Centralized)
gemini-3.1-flash-image🌐 Global (Centralized)
claude-opus-5⚡ Geo-DistributedAMER, EMEA, APAC
kimi-k3🌐 Global (Centralized)APAC
gpt-5.6-sol⚡ Geo-DistributedAMER, EMEA
gpt-5.6-terra⚡ Geo-DistributedAMER, EMEA
gpt-5.6-luna⚡ Geo-DistributedAMER, EMEA
claude-sonnet-5⚡ Geo-DistributedAMER, EMEA, APAC
claude-opus-4.8⚡ Geo-DistributedAMER, EMEA, APAC
glm-5.2🌐 Global (Centralized)APAC
minimax-m3🌐 Global (Centralized)APAC
gemini-3.5-flash🌐 Global (Centralized)-
kimi-k2.6🌐 Global (Centralized)APAC
glm-5.1🌐 Global (Centralized)APAC
minimax-m2.7🌐 Global (Centralized)APAC
deepseek-v4-pro🌐 Global (Centralized)APAC
gpt-5.5⚡ Geo-DistributedAMER, EMEA
gpt-5.4⚡ Geo-DistributedAMER, EMEA, APAC
gpt-5.4-mini⚡ Geo-DistributedAMER, EMEA, APAC
gpt-5.4-nano⚡ Geo-DistributedAMER, EMEA
gemini-3.1-flash-lite-preview🌐 Global (Centralized)-
gemini-3.1-pro-preview🌐 Global (Centralized)
claude-opus-4.7⚡ Geo-DistributedAMER, EMEA, APAC
claude-opus-4.6⚡ Geo-DistributedAMER, EMEA
claude-sonnet-4.6⚡ Geo-DistributedAMER, EMEA
claude-opus-4.5⚡ Geo-DistributedAMER, EMEA
gpt-5.3-codex⚡ Geo-DistributedAMER, EMEA
gpt-5.2-codex⚡ Geo-DistributedAMER, EMEA
gpt-5.1-codex-max⚡ Geo-DistributedAMER, EMEA
gpt-5.1-codex⚡ Geo-DistributedAMER, EMEA, APAC
gpt-5.2⚡ Geo-DistributedAMER, EMEA
gpt-5.1⚡ Geo-DistributedAMER, EMEA
gpt-5⚡ Geo-DistributedAMER, EMEA, APAC
gpt-5-mini⚡ Geo-DistributedAMER, EMEA, APAC
gemini-2.5-pro🌐 Global (Centralized)
gemini-2.5-flash🌐 Global (Centralized)

Key Highlights

  • Dynamic Routing — Vivgrid automatically detects the user’s region and routes requests to the nearest accelerated node, minimizing cross-continent latency.
  • Tool Synchronization — AI tools and context caches are replicated across all accelerated regions for consistent behavior.
  • Adaptive Caching — Frequently accessed prompts and embeddings are regionally cached to reduce cold-start delays.
  • Seamless Fallback — Traffic automatically re-routes to neighboring accelerated zones during high load or outages.

Notes on Global Models

For Global-only models (e.g., gemini-3.1-pro-preview), the model host remains centralized under the provider’s Global Standard endpoint, limiting VivGrid’s ability to perform regional acceleration.
In contrast, Geo-Distributed models (e.g., gpt-5.6-sol,claude-opus-5) leverage Vivgrid’s orchestration layer — delivering sub-50 ms latency worldwide through intelligent regional acceleration.

On this page