AiST.Ai
aist.llm / own-models · api · dedicated · on-prem

Grandes modelos de linguagem próprios — API, instâncias dedicadas e on-prem.

A gama de LLM próprios da AiST: modelos generativos multilingues e de código, multimodais com vision, embeddings, até 1M de tokens de contexto. API compatível com OpenAI, instância dedicada ou on-prem no seu centro de dados, fine-tuning para o seu setor.

  • ◯ 4 modelos: Pro · Light · Code · Vision
  • ⌬ API compatível com OpenAI
  • ≡ Até 1M de tokens de contexto
  • ⊞ Fine-tuning com os seus dados
  • ⛨ 152-FZ · on-prem · air-gapped
// gama de modelos

4 modelos próprios — para diferentes tarefas e orçamentos.

Não «um modelo universal», mas tamanhos e especializações concebidos de propósito. Pro para tarefas complexas, Light para tarefas em massa, Code para desenvolvimento, Vision para documentos e imagens. Todos — através de uma única API.

flagship aist-llm-pro

Pro

Modelo grande para tarefas complexas: análise de contratos, fact-check, agentes, reasoning. Nível Claude Sonnet / GPT-4o.

contexto256K
modalidadestext · vision
preço de entrada40 ₽ / 1M
tools / jsonsim
aist-llm-light

Light

Rápido e económico para operações em massa: chats, classificação, etiquetas, resumos. ~10 vezes mais barato do que o Pro em tarefas típicas.

contexto128K
velocidade~ 300 tok/s
preço de entrada4 ₽ / 1M
tools / jsonsim
aist-llm-code

Code

Especializado em desenvolvimento: geração de código, revisão, testes, debugging, migrações. Conhece 1C, Python, TS, Go, Rust, SQL, Bash.

contexto200K
linguagens de código40+
preço de entrada20 ₽ / 1M
FIM & agenticsim
aist-llm-vision

Vision

Multimodal: texto + imagens. Leitura de documentos, esquemas, plantas, gráficos, capturas de ecrã de UI. Integrado com o AiST OCR.

contexto128K
img por pedidoaté 20
preço de entrada30 ₽ / 1M
+ OCRintegrado
+ EMBED aist-embed-ru-v3 · modelo independente de embeddings para RAG, pesquisa e clustering. 2 ₽ / 1M tokens · vetor de 1024 dimensões · sliding-window até 8K.
// opções de implementação

Nuvem, instância dedicada ou on-prem — escolha de acordo com os seus requisitos de segurança.

Comece em 5 minutos com a API partilhada. Para cargas elevadas — uma instância dedicada com rate-limit e SLA próprios. Para a 152-FZ e um perímetro fechado — implementação on-prem no seu próprio hardware.

⌬

Public API

Endpoint multi-tenant partilhado. Pay-as-you-go por tokens. Começa em 5 minutos — obtém a chave e começa a enviar pedidos. Adequado para protótipos e cargas médias.

tarifapay-as-you-go
SLA99.5%
arranque5 min
⊞

Dedicated

Instância dedicada do modelo na nossa nuvem, só para si. Throughput garantido, chaves independentes, rate-limit personalizado, SLA 99.9%, baixa latência.

tarifareserved capacity
SLA99.9%
arranque1–3 dias
⛨

On-prem

Implementamos os modelos no seu centro de dados, no seu hardware. Os dados não saem do perímetro. 152-FZ. Adequado para a banca, o setor público e a defesa.

tarifalicença
hardwareas suas GPU
arranque2–4 semanas
⛓

Air-gapped

On-prem sem um único byte para o exterior. Entrega dos modelos em ficheiros, atualizações em suporte físico. Para infraestruturas críticas.

tarifalicença
internetnão necessária
STR-Kcompatível
// como funciona

Do pedido no seu código — à resposta do modelo em 200 ms. Através de uma única API.

O endpoint compatível com OpenAI recebe o pedido, o balanceador encaminha-o para o modelo e a região adequados, a inferência é executada no nosso cluster de GPU (ou no seu, para on-prem) e a resposta regressa em streaming. Faturação por tokens, transparente.

// L1 · pedido
sdk compatível com OpenAI migração em 5 min
auth chave de API Bearer + scope
route seleção de modelo pro · light · code · vision
limit rate & budget limite por chave
↓
// L2 · inferência
balance balanceador region · gpu pool
cache prompt cache −40% na fatura
infer inferência em GPU vLLM · TensorRT
tools function-calling + JSON-mode
↓
// L3 · resposta & contabilização
stream resposta em streaming SSE · 200 ms TTFT
safety guardrails PII · brand-safety
billing faturação por tokens por chave
audit registo do pedido no SIEM, opcionalmente
  • 01
    Substitua a OpenAI em 5 minutos Altere o base_url do OpenAI SDK para `https://api.aist.ai/v1` — e tudo funciona. A mesma interface chat.completions, a mesma semântica de streaming, o mesmo function-calling.
  • 02
    Balanceador e cache O pedido segue para o pool de GPU mais próximo; a prompt-cache capta os contextos repetidos (prompts de sistema, contexto RAG) e poupa até 40% da fatura.
  • 03
    Function-calling e JSON-mode O modelo invoca as suas funções por si próprio (tool-use), devolve JSON estrito segundo o esquema e suporta streaming e long-context. Compatível com qualquer framework de agentes.
  • 04
    Faturação transparente Faturação por tokens, sem riscos cambiais. Orçamento por chave, limite por equipa, bloqueio automático ao ultrapassá-lo. Relatórios para o CFO — de série.
// capacidades

Não é «mais uma LLM-API». É uma gama completa para tarefas empresariais.

Streaming, function-calling, JSON-mode, vision, embeddings, fine-tuning, modo batch, prompt-cache. Tudo o que é necessário para produção — numa única API, com os seus dados, no seu perímetro.

◯

API compatível com OpenAI

chat.completions, embeddings, streaming — como na OpenAI. A migração é alterar o base_url.

api
≡

Até 1M de contexto

aist-llm-pro — 256K; versão alargada de 1M. Um livro inteiro ou uma base de contratos num único pedido.

long-context
⌬

Function-calling

O modelo invoca as suas API por si próprio. Tool-calls em paralelo, structured output, JSON-mode.

tools · json
▦

Vision & multimodal

aist-llm-vision suporta até 20 imagens por pedido. Documentos, esquemas, gráficos, UI.

vision
⊞

Fine-tuning

Retreino para o seu domínio — 500–5000 exemplos e no dia seguinte tem o seu modelo.

finetune · lora
↻

Streaming <200 ms

Stream SSE, TTFT ~200 ms. O utilizador vê a resposta de imediato, sem esperar 10 segundos de silêncio.

stream · sse
⌗

Prompt-cache

Os prompts de sistema repetidos e o contexto RAG ficam em cache. Menos 40% na fatura.

cache · finops
⏱

Modo batch

Um milhão de pedidos por noite — 50% mais barato do que os síncronos. Para auditorias e etiquetagem.

batch
⛨

Guardrails & PII

Filtros de temas, proteção contra injeções, mascaramento de PII à entrada e à saída.

safety
⌘

Embeddings

aist-embed-ru-v3, 1024-d, até 8K tokens. 2 ₽ / 1M. Para RAG e pesquisa.

vectors
▤

Painel de utilização

Pedidos por chave, tokens, custo, erros, latência p50/p95/p99.

analytics
⛓

SDK & integrações

Python, Node, Go, Rust, .NET, 1C. Compatível com LangChain, LlamaIndex, AutoGen.

sdk
// tarifas & modelos de consumo

Pague apenas pelo que utiliza. Sem riscos cambiais.

Preços transparentes por tokens. Descontos por volume, modo batch, compra de reserved-capacity. Orçamentos por chaves e equipas — para que o CFO não se assuste com as faturas.

// tarifação

per-tokenreserved capacitybatch −50%cache −40%volume discountlicença on-prem

// modelos

aist-llm-proaist-llm-lightaist-llm-codeaist-llm-visionaist-embed-ru+ fine-tuned

// formas de pagamento

transferência bancáriapré-pagamentopagamento diferido (B2B)cartãopagamento instantâneo

// sdk & plataformas

OpenAI PythonOpenAI Node1C (cliente HTTP)cURLLangChainLlamaIndex

// regiões

ru-central-1 (Moscovo)ru-northwest-1 (São Petersburgo)ru-siberia-1 (Novosibirsk)on-prem no seu centro de dados

// integração com os serviços AiST

RAGOCRASRImageVideoDialogAgentModeration

Preços claros, previsíveis, empresariais.

Free-tier para começar (100 mil tokens no Pro). Desconto por volume e reserved-capacity. Para clientes empresariais — pagamento diferido por fatura, orçamentos por departamento, contrato único. Sem «surpresas noturnas» na fatura.

40 ₽/ 1M tokens Pro
4 ₽/ 1M tokens Light
−40%com prompt-cache
⌬
Pay-as-you-go

Pagamento de acordo com a utilização real. Começa com 100K tokens gratuitos e depois — segundo a tarifa.

⊞
Reserved capacity

Capacidade reservada com um desconto de 30–50%. Para cargas elevadas e estáveis.

⛨
Licença on-prem

Licença perpétua para implementar no seu perímetro. Sem faturação por tokens: paga apenas o seu próprio hardware.

// o que se constrói com o AiST LLM

Do chat empresarial a agentes em produção e modelos custom.

O LLM é a infraestrutura das aplicações de IA. Qualquer assistente, agente, motor de pesquisa, analítica ou chat seu vive sobre um LLM. É o bloco de construção básico sem o qual nada funciona.

// chat empresarial

Um ChatGPT empresarial no seu perímetro

Painel web, bot de Telegram, widget no 1C — os colaboradores conversam com o LLM sem que os dados fujam para a OpenAI. Todos os pedidos — sob auditoria, por perfis, em conformidade com a 152-FZ.

RBACauditoria152-FZ
// desenvolvimento

Code-assistant no IDE

aist-llm-code no VSCode, Cursor, JetBrains através da API padrão. Geração, refatoração, testes, revisão de PR. Conhece 1C, Python, TS e o seu legacy.

VSCode1Ccode-review
// aplicações de ia

Backend para as suas funcionalidades de IA

Por baixo do seu produto — a nossa LLM-API. Assistente de chat, classificação, resumos, geração de descrições de produto. Uma API para todo o produto.

SaaSweb-appmobile
// fine-tuning

Modelo custom para o seu setor

Retreino com 5000 exemplos da sua terminologia (medicina, direito, oil & gas) — e o modelo responde «como o seu especialista». Qualidade no seu domínio — +20–40%.

LoRASFTRLHF
// agentes

Motor para o AiST Agent

Por baixo dos nossos agentes — o nosso próprio LLM. Function-calling, JSON-mode, contexto longo, baixa latência. Um agente de 100 passos termina em 3 minutos.

toolsmulti-step200K ctx
// research & analítica

Processamento batch de milhões de registos

«Classifique 10 milhões de avaliações», «resuma 1 milhão de chamadas», «extraia os factos de 500 000 contratos» — a batch-API é 50% mais barata e termina numa noite.

batchsummaryclassification
// já na plataforma

Os modelos próprios são a base de todos os outros serviços da AiST.

Cada serviço da AiST utiliza por baixo os nossos próprios LLM. O RAG gera respostas com o Pro, o Dialog conversa com o Light, o Agent trabalha com o Pro e function-calling, o OCR usa ainda o Vision. Ao contratar o AiST LLM — tem todo o ecossistema ao alcance da mão.

Não é só uma API. É todo o ecossistema AiST.

Pode contratar apenas a API e construir o que é seu. Ou usar diretamente os serviços prontos sobre o LLM: RAG para pesquisar em documentos, Agent para tarefas autónomas, Dialog para atender os clientes. Um único painel, uma única fatura, moderação e auditoria unificadas.

«Usávamos o GPT-4 através de VPN, preocupados todos os dias com a lei federal russa 152-FZ. Passámos para o aist-llm-pro — a qualidade revelou-se superior, fatura transparente, sem VPN nem riscos jurídicos»

O que mais oferece a AiST Platform→
◯
4 modelos + embeddingsPro · Light · Code · Vision · Embed
✓ pronto
⌬
API compatível com OpenAImigração em 5 minutos
✓ pronto
⊞
Dedicated & on-prem & air-gappedpara qualquer nível de segurança
✓ pronto
↻
Streaming + tools + JSON200 ms TTFT
✓ pronto
⌗
Prompt-cache + batch−40% e −50% na fatura
✓ pronto
⊕
Fine-tuning para o seu domínioLoRA · SFT · RLHF
✓ pronto
⛨
Guardrails + PII + RBACproteção à entrada e à saída
✓ pronto
⛓
Integração com RAG / Agent / Dialogtodo o ecossistema por cima
✓ pronto
// controlo empresarial

LLM sem VPN e sem riscos jurídicos: 152-FZ e contrato local.

O GPT-4 através de VPN viola as condições de utilização da OpenAI e representa um risco potencial face à 152-FZ. O AiST LLM resolve ambos os problemas: os modelos no seu perímetro, faturação transparente, contrato em conformidade com a legislação local.

// para o CISO

Perímetro fechado

  • On-prem ou AiST BOX no seu centro de dados
  • Variante air-gapped para infraestruturas críticas
  • Os pedidos não saem para o estrangeiro
  • RBAC: chaves por equipa, scopes por modelo
  • Proteção contra prompt-injection à entrada
  • Exportação para o SIEM de cada pedido
// para os juristas

Segurança jurídica

  • 152-FZ — dados pessoais no seu perímetro
  • Contrato sob jurisdição local
  • Sem VPN nem violações de ToS
  • Inscrito no registo nacional de software
  • Certificação FSTEC (em curso)
  • Compatível com STR-K
// para o CFO

Despesas transparentes

  • Faturação sem riscos cambiais
  • Orçamentos por chaves e equipas
  • Cache e batch — menos 40–50% na fatura
  • Reserved capacity com um desconto de 30–50%
  • Pagamento diferido por fatura para B2B
  • Documentação de fecho segundo a norma local
// perguntas frequentes

O que costumam perguntar-nos antes de migrar da OpenAI.

A qualidade não é mesmo inferior ao GPT-4 / Claude?

O aist-llm-pro está ao nível do Claude Sonnet e do GPT-4o e, em vários domínios (textos jurídicos, 1C, relatórios administrativos), é notoriamente mais preciso, porque foi treinado tendo em conta essas especificidades. Mostramos-lhe um benchmark com as suas próprias tarefas numa semana de piloto.

Quanto tempo demora a migração da OpenAI?

5 minutos para o código. Altere o `base_url` do OpenAI SDK para `https://api.aist.ai/v1` e o nome do modelo para `aist-llm-pro` — e tudo funciona. Streaming, function-calling e JSON-mode são compatíveis um a um.

É possível implementar o modelo no nosso centro de dados?

Sim, a versão on-prem é fornecida para Pro, Light, Code, Vision e Embed. Calculamos o dimensionamento de GPU de acordo com o seu tráfego (normalmente 1–4 H100 para uma empresa média). A entrega air-gapped é feita em suporte físico, sem internet.

É mesmo possível afinar o modelo com a nossa terminologia?

Sim. No mínimo 500 exemplos de qualidade «pergunta-resposta» no seu estilo. O ideal — 2000–5000. Num dia — o seu modelo custom através da mesma API. Pode manter vários modelos fine-tuned em simultâneo, para diferentes equipas.

Quanto custaria com a nossa carga?

Calculamos de acordo com o seu perfil de pedidos. Como referência: uma empresa média com 1000 colaboradores e chat empresarial — ~50–150 mil ₽/mês no Pro com cache. Para cargas elevadas, a reserved capacity oferece 30–50% de desconto. Para air-gapped — licença única + o seu próprio hardware.

Podemos usar apenas o LLM ou é preciso contratar toda a plataforma?

Pode contratar apenas a LLM-API — é um produto completo. Mas a verdadeira potência surge em combinação com RAG (pesquisa em documentos), Agent (tarefas autónomas), Dialog (widget e mensagens), OCR/ASR/Image. Um único painel, uma única fatura, auditoria unificada.

// próximo passo

Obtenha uma chave de API em 5 minutos e meça a qualidade com os seus próprios pedidos.

Registe-se — receba uma chave e 100 mil tokens gratuitos no aist-llm-pro. Teste os seus prompts e compare com o GPT-4 ou o Claude. Decida com base em números.

// ao enviar, o senhor aceita o tratamento dos seus dados pessoais