AiST.Ai
aist.ai-gateway / 50+ models · pagamento em ₽

Qualquer LLM do mundo — através de uma única API e a partir da Rússia.

GPT-4, Claude, Gemini, o1, Llama, GigaChat, o seu modelo local — tudo num único endpoint, API compatível com a OpenAI. Pagamento em rublos, contrato com uma pessoa coletiva da Federação Russa, conformidade com a lei federal russa 152-FZ. Encaminhamento inteligente por preço, latência, região ou fallback em caso de falha do fornecedor — troca o modelo na configuração, não no código. Faturação e limites unificados por equipas, auditoria de pedidos, novas tentativas e cache de respostas prontos a usar.

  • ◉ Pagamento em ₽ · contrato na FR
  • ↔ API compatível com a OpenAI
  • ⚡ Latência <120 ms
  • ⛨ 152-FZ · auditoria
// o problema

Na Rússia, o acesso às LLM é sempre um problema.

A OpenAI bloqueia, a Anthropic não aceita pagamentos, não é possível registar uma pessoa coletiva russa, as chaves são revogadas. O Gateway resolve os três problemas com uma única ligação.

// acesso

Não há uma via legal para a OpenAI e a Anthropic

Os fornecedores estrangeiros bloqueiam os IP russos, os cartões bancários e as pessoas coletivas. Os desvios por VPN são proibidos pela política corporativa e são instáveis.

→
Proxy através de uma entidade jurídica na UE/EAU + contrato com a AiST na Federação Russa. Legal, estável e com documentação de fecho.
// pagamento

É impossível pagar os tokens em divisas

O SWIFT não funciona, os cartões não são aceites e a contabilidade não processará criptomoedas. Perde horas em soluções alternativas em vez de desenvolver.

→
Pagamento por fatura em rublos, auto + fatura fiscal, com a periodicidade que preferir. Um único contrato — todos os fornecedores do mundo.
// escala

Os seus próprios modelos não aguentam a carga

O vLLM cai, a GPU fica inativa, a fila cresce. A equipa de ML-ops torna-se o estrangulamento de todos os lançamentos de produto.

→
Ligamos o seu self-hosted ao Gateway: load-balancing, fallback, autoescalamento. O seu modelo funciona como qualquer outro fornecedor.
// catálogo

50+ modelos. Frontier, locais e os seus próprios.

Os melhores modelos do mundo + os maiores modelos russos + compatibilidade com qualquer open-source através de self-host. Troca uma linha de código — a aplicação continua a funcionar.

OpenAI🇺🇸

GPT-4o · GPT-4.1 · o1 · o3-mini

visionfunction-call
Anthropic🇺🇸

Claude Sonnet 4.5 · Opus 4 · Haiku 4.5

200k ctxvision
Google🇺🇸

Gemini 2.5 Pro · 2.5 Flash

1M ctxmultimodal
xAI🇺🇸

Grok-4 · Grok-3

realtime
Meta⚙

Llama 4 · 3.3-70B · 3.2-90B

localvision
Mistral🇫🇷

Large 2 · Codestral · Pixtral

localcode
DeepSeek🇨🇳

DeepSeek-R1 · V3

localreasoning
Qwen🇨🇳

Qwen-3 · Qwen-VL · Qwen-Coder

local
Sber🇷🇺

GigaChat Pro · GigaChat Max

RU152-FZ
Yandex🇷🇺

YandexGPT 5 Pro · Lite

RU152-FZ
T-Bank🇷🇺

T-pro · T-lite

RUlocal
Self-host⚙

O seu modelo no seu próprio perímetro

on-premvLLM · TGI
// interface unificada

Um SDK, compatível com a OpenAI. Sem reescrever nada.

Altere o base_url e a chave — e continue a programar contra a mesma interface. Toda a biblioteca de funções da OpenAI: streaming, tools, JSON-mode, vision, embeddings.

example.py
python node curl
# Qualquer modelo — uma única linha
from openai import OpenAI

client = OpenAI(
  base_url="https://api.aist.ai/v1",
  api_key="aist_sk_...",
)

response = client.chat.completions.create(
  model="claude-sonnet-4.5",  # ou gpt-4o, gigachat, llama-70b…
  messages=[{"role": "user", "content": "Olá"}],
  stream=True,
)

O que inclui

  • → Streaming, tools, JSON-mode, vision, embeddings
  • → Fallback automático para um modelo de reserva em caso de erro
  • → Cache de respostas e deduplicação de pedidos
  • → Métricas, auditoria, orçamentos por equipas e projetos
  • → SDK para Python, JS, Go, Java, Kotlin, Swift
// funcionalidades

O que o Gateway acrescenta à API «em bruto».

Não somos um simples proxy. É uma camada de proteção, controlo e encaminhamento inteligente sobre qualquer LLM.

⇄

Encaminhamento e fallback

Regras como «se o Claude não estiver disponível → GPT-4o → GigaChat». Encaminhamento baseado na latência, sticky-sessions, testes A/B com tráfego real.

<50 msoverhead
99.97%uptime
₽

Controlo de despesas

Orçamentos por equipas, projetos e utilizadores. Limites rigorosos, alertas no Slack/Telegram, relatórios no 1C. Painel «para onde vai cada ₽».

−42%poupança média
real-timemétricas
⛨

Segurança e PII

Anonimização de dados pessoais antes do envio para APIs externas, filtros de entrada e saída, auditoria completa dos pedidos. RBAC, SSO, MFA.

152-FZcompatível
SOC2type II
⌬

Cache e deduplicação

Cache semântica de pedidos repetidos, cache RAG de embeddings. Em cargas típicas poupa entre 30 e 60% dos tokens sem perda de qualidade.

~45%cache hit-rate
×3RPS com as mesmas GPU
// escalamento dos seus próprios modelos

Ligue o seu modelo — o Gateway coloca-o em produção.

O senhor treina o modelo; nós encarregamo-nos do escalamento sob carga, da monitorização, do fallback e da faturação. A sua equipa de ML ocupa-se dos dados, não da infraestrutura.

01

Autoescalamento do pool de GPU

Levantamos nós adicionais quando o RPS cresce e desligamo-los em repouso. Nada de H100 inativas à sua custa.

02

Implementações canary e testes A/B

Implemente a nova versão do modelo em 5% do tráfego, compare métricas e reverta com um único clique. Sem tempo de inatividade.

03

Inferência distribuída

Paralelismo tensorial, speculative decoding, batching. vLLM, TensorRT-LLM e SGLang prontos a usar.

04

Monitorização e SLA

Latência p50/p95/p99, throughput, utilização de GPU, accuracy drift. Alertas no seu PagerDuty ou bot de Telegram.

05

Fine-tuning como serviço

Carregue o dataset, escolha o modelo base — e receba o adaptador. LoRA, QLoRA, full fine-tune, RLHF nos seus servidores ou nos nossos.

// perguntas frequentes

O que convém saber antes de se ligar.

É legal para uma pessoa coletiva da Federação Russa?

Sim. A AiST é uma empresa russa, com contrato e documentação de fecho conforme as normas contabilísticas russas (RSBU). O acesso aos fornecedores estrangeiros é feito através da nossa entidade jurídica na UE/EAU. Toda a cadeia é transparente, sem qualquer VPN.

E quanto à lei federal russa 152-FZ e ao sigilo bancário?

Para dados sensíveis — apenas modelos nacionais ou o seu self-host. Para o resto — anonimização de PII integrada antes do envio. Auditoria de todos os pedidos, RBAC, SSO.

Quanto custa e como se paga?

Sem subscrição. Paga apenas pelos tokens — uma margem de 8–12% sobre o preço oficial do fornecedor. Pagamento por fatura em rublos, pré-pagamento ou pagamento a 30 dias. Não há volume mínimo.

Como ligo o meu próprio modelo?

Se está no seu perímetro — fornece-nos o URL e registamo-lo como fornecedor. Se for preciso implementá-lo — pegamos no seu checkpoint do HuggingFace ou PyTorch e implementamo-lo nas suas GPU ou nas nossas em 48 horas.

Que SLA oferecem?

99.95% de disponibilidade do Gateway, tempo de resposta de 15 minutos (24×7), compensação em tokens em caso de incumprimento. Ao nível dos modelos — o fallback comuta automaticamente para o fornecedor de reserva.

Pode ser executado in-house, sem a vossa nuvem?

Sim. O Gateway faz parte do AiST Ai BOX — instala-se no seu centro de dados e funciona num perímetro fechado. Todas as funcionalidades são mantidas.

// próximo passo

A chave em 1 dia. O orçamento de teste fica a cargo da AiST.

Enviamos-lhe a chave de API, a documentação e um orçamento inicial de ₽3 000 para testes. Assinamos o contrato quando comprovar que funciona.

// ao enviar, o senhor aceita o tratamento dos seus dados pessoais