Qualquer LLM do mundo — através de uma única API e a partir da Rússia.
GPT-4, Claude, Gemini, o1, Llama, GigaChat, o seu modelo local — tudo num único endpoint, API compatível com a OpenAI. Pagamento em rublos, contrato com uma pessoa coletiva da Federação Russa, conformidade com a lei federal russa 152-FZ. Encaminhamento inteligente por preço, latência, região ou fallback em caso de falha do fornecedor — troca o modelo na configuração, não no código. Faturação e limites unificados por equipas, auditoria de pedidos, novas tentativas e cache de respostas prontos a usar.
- ◉ Pagamento em ₽ · contrato na FR
- ↔ API compatível com a OpenAI
- ⚡ Latência <120 ms
- ⛨ 152-FZ · auditoria
Na Rússia, o acesso às LLM é sempre um problema.
A OpenAI bloqueia, a Anthropic não aceita pagamentos, não é possível registar uma pessoa coletiva russa, as chaves são revogadas. O Gateway resolve os três problemas com uma única ligação.
Não há uma via legal para a OpenAI e a Anthropic
Os fornecedores estrangeiros bloqueiam os IP russos, os cartões bancários e as pessoas coletivas. Os desvios por VPN são proibidos pela política corporativa e são instáveis.
É impossível pagar os tokens em divisas
O SWIFT não funciona, os cartões não são aceites e a contabilidade não processará criptomoedas. Perde horas em soluções alternativas em vez de desenvolver.
Os seus próprios modelos não aguentam a carga
O vLLM cai, a GPU fica inativa, a fila cresce. A equipa de ML-ops torna-se o estrangulamento de todos os lançamentos de produto.
50+ modelos. Frontier, locais e os seus próprios.
Os melhores modelos do mundo + os maiores modelos russos + compatibilidade com qualquer open-source através de self-host. Troca uma linha de código — a aplicação continua a funcionar.
GPT-4o · GPT-4.1 · o1 · o3-mini
Claude Sonnet 4.5 · Opus 4 · Haiku 4.5
Gemini 2.5 Pro · 2.5 Flash
Grok-4 · Grok-3
Llama 4 · 3.3-70B · 3.2-90B
Large 2 · Codestral · Pixtral
DeepSeek-R1 · V3
Qwen-3 · Qwen-VL · Qwen-Coder
GigaChat Pro · GigaChat Max
YandexGPT 5 Pro · Lite
T-pro · T-lite
O seu modelo no seu próprio perímetro
Um SDK, compatível com a OpenAI. Sem reescrever nada.
Altere o base_url e a chave — e continue a programar contra a mesma interface. Toda a biblioteca de funções da OpenAI: streaming, tools, JSON-mode, vision, embeddings.
# Qualquer modelo — uma única linha from openai import OpenAI client = OpenAI( base_url="https://api.aist.ai/v1", api_key="aist_sk_...", ) response = client.chat.completions.create( model="claude-sonnet-4.5", # ou gpt-4o, gigachat, llama-70b… messages=[{"role": "user", "content": "Olá"}], stream=True, )
O que inclui
- → Streaming, tools, JSON-mode, vision, embeddings
- → Fallback automático para um modelo de reserva em caso de erro
- → Cache de respostas e deduplicação de pedidos
- → Métricas, auditoria, orçamentos por equipas e projetos
- → SDK para Python, JS, Go, Java, Kotlin, Swift
O que o Gateway acrescenta à API «em bruto».
Não somos um simples proxy. É uma camada de proteção, controlo e encaminhamento inteligente sobre qualquer LLM.
Encaminhamento e fallback
Regras como «se o Claude não estiver disponível → GPT-4o → GigaChat». Encaminhamento baseado na latência, sticky-sessions, testes A/B com tráfego real.
Controlo de despesas
Orçamentos por equipas, projetos e utilizadores. Limites rigorosos, alertas no Slack/Telegram, relatórios no 1C. Painel «para onde vai cada ₽».
Segurança e PII
Anonimização de dados pessoais antes do envio para APIs externas, filtros de entrada e saída, auditoria completa dos pedidos. RBAC, SSO, MFA.
Cache e deduplicação
Cache semântica de pedidos repetidos, cache RAG de embeddings. Em cargas típicas poupa entre 30 e 60% dos tokens sem perda de qualidade.
Ligue o seu modelo — o Gateway coloca-o em produção.
O senhor treina o modelo; nós encarregamo-nos do escalamento sob carga, da monitorização, do fallback e da faturação. A sua equipa de ML ocupa-se dos dados, não da infraestrutura.
Autoescalamento do pool de GPU
Levantamos nós adicionais quando o RPS cresce e desligamo-los em repouso. Nada de H100 inativas à sua custa.
Implementações canary e testes A/B
Implemente a nova versão do modelo em 5% do tráfego, compare métricas e reverta com um único clique. Sem tempo de inatividade.
Inferência distribuída
Paralelismo tensorial, speculative decoding, batching. vLLM, TensorRT-LLM e SGLang prontos a usar.
Monitorização e SLA
Latência p50/p95/p99, throughput, utilização de GPU, accuracy drift. Alertas no seu PagerDuty ou bot de Telegram.
Fine-tuning como serviço
Carregue o dataset, escolha o modelo base — e receba o adaptador. LoRA, QLoRA, full fine-tune, RLHF nos seus servidores ou nos nossos.
O que convém saber antes de se ligar.
É legal para uma pessoa coletiva da Federação Russa?
Sim. A AiST é uma empresa russa, com contrato e documentação de fecho conforme as normas contabilísticas russas (RSBU). O acesso aos fornecedores estrangeiros é feito através da nossa entidade jurídica na UE/EAU. Toda a cadeia é transparente, sem qualquer VPN.
E quanto à lei federal russa 152-FZ e ao sigilo bancário?
Para dados sensíveis — apenas modelos nacionais ou o seu self-host. Para o resto — anonimização de PII integrada antes do envio. Auditoria de todos os pedidos, RBAC, SSO.
Quanto custa e como se paga?
Sem subscrição. Paga apenas pelos tokens — uma margem de 8–12% sobre o preço oficial do fornecedor. Pagamento por fatura em rublos, pré-pagamento ou pagamento a 30 dias. Não há volume mínimo.
Como ligo o meu próprio modelo?
Se está no seu perímetro — fornece-nos o URL e registamo-lo como fornecedor. Se for preciso implementá-lo — pegamos no seu checkpoint do HuggingFace ou PyTorch e implementamo-lo nas suas GPU ou nas nossas em 48 horas.
Que SLA oferecem?
99.95% de disponibilidade do Gateway, tempo de resposta de 15 minutos (24×7), compensação em tokens em caso de incumprimento. Ao nível dos modelos — o fallback comuta automaticamente para o fornecedor de reserva.
Pode ser executado in-house, sem a vossa nuvem?
Sim. O Gateway faz parte do AiST Ai BOX — instala-se no seu centro de dados e funciona num perímetro fechado. Todas as funcionalidades são mantidas.
A chave em 1 dia. O orçamento de teste fica a cargo da AiST.
Enviamos-lhe a chave de API, a documentação e um orçamento inicial de ₽3 000 para testes. Assinamos o contrato quando comprovar que funciona.