Grandes modelos de linguagem próprios — API, instâncias dedicadas e on-prem.
A gama de LLM próprios da AiST: modelos generativos multilingues e de código, multimodais com vision, embeddings, até 1M de tokens de contexto. API compatível com OpenAI, instância dedicada ou on-prem no seu centro de dados, fine-tuning para o seu setor.
- ◯ 4 modelos: Pro · Light · Code · Vision
- ⌬ API compatível com OpenAI
- ≡ Até 1M de tokens de contexto
- ⊞ Fine-tuning com os seus dados
- ⛨ 152-FZ · on-prem · air-gapped
4 modelos próprios — para diferentes tarefas e orçamentos.
Não «um modelo universal», mas tamanhos e especializações concebidos de propósito. Pro para tarefas complexas, Light para tarefas em massa, Code para desenvolvimento, Vision para documentos e imagens. Todos — através de uma única API.
Pro
Modelo grande para tarefas complexas: análise de contratos, fact-check, agentes, reasoning. Nível Claude Sonnet / GPT-4o.
Light
Rápido e económico para operações em massa: chats, classificação, etiquetas, resumos. ~10 vezes mais barato do que o Pro em tarefas típicas.
Code
Especializado em desenvolvimento: geração de código, revisão, testes, debugging, migrações. Conhece 1C, Python, TS, Go, Rust, SQL, Bash.
Vision
Multimodal: texto + imagens. Leitura de documentos, esquemas, plantas, gráficos, capturas de ecrã de UI. Integrado com o AiST OCR.
Nuvem, instância dedicada ou on-prem — escolha de acordo com os seus requisitos de segurança.
Comece em 5 minutos com a API partilhada. Para cargas elevadas — uma instância dedicada com rate-limit e SLA próprios. Para a 152-FZ e um perímetro fechado — implementação on-prem no seu próprio hardware.
Public API
Endpoint multi-tenant partilhado. Pay-as-you-go por tokens. Começa em 5 minutos — obtém a chave e começa a enviar pedidos. Adequado para protótipos e cargas médias.
Dedicated
Instância dedicada do modelo na nossa nuvem, só para si. Throughput garantido, chaves independentes, rate-limit personalizado, SLA 99.9%, baixa latência.
On-prem
Implementamos os modelos no seu centro de dados, no seu hardware. Os dados não saem do perímetro. 152-FZ. Adequado para a banca, o setor público e a defesa.
Air-gapped
On-prem sem um único byte para o exterior. Entrega dos modelos em ficheiros, atualizações em suporte físico. Para infraestruturas críticas.
Do pedido no seu código — à resposta do modelo em 200 ms. Através de uma única API.
O endpoint compatível com OpenAI recebe o pedido, o balanceador encaminha-o para o modelo e a região adequados, a inferência é executada no nosso cluster de GPU (ou no seu, para on-prem) e a resposta regressa em streaming. Faturação por tokens, transparente.
-
01
Substitua a OpenAI em 5 minutos Altere o base_url do OpenAI SDK para `https://api.aist.ai/v1` — e tudo funciona. A mesma interface chat.completions, a mesma semântica de streaming, o mesmo function-calling.
-
02
Balanceador e cache O pedido segue para o pool de GPU mais próximo; a prompt-cache capta os contextos repetidos (prompts de sistema, contexto RAG) e poupa até 40% da fatura.
-
03
Function-calling e JSON-mode O modelo invoca as suas funções por si próprio (tool-use), devolve JSON estrito segundo o esquema e suporta streaming e long-context. Compatível com qualquer framework de agentes.
-
04
Faturação transparente Faturação por tokens, sem riscos cambiais. Orçamento por chave, limite por equipa, bloqueio automático ao ultrapassá-lo. Relatórios para o CFO — de série.
Não é «mais uma LLM-API». É uma gama completa para tarefas empresariais.
Streaming, function-calling, JSON-mode, vision, embeddings, fine-tuning, modo batch, prompt-cache. Tudo o que é necessário para produção — numa única API, com os seus dados, no seu perímetro.
API compatível com OpenAI
chat.completions, embeddings, streaming — como na OpenAI. A migração é alterar o base_url.
Até 1M de contexto
aist-llm-pro — 256K; versão alargada de 1M. Um livro inteiro ou uma base de contratos num único pedido.
Function-calling
O modelo invoca as suas API por si próprio. Tool-calls em paralelo, structured output, JSON-mode.
Vision & multimodal
aist-llm-vision suporta até 20 imagens por pedido. Documentos, esquemas, gráficos, UI.
Fine-tuning
Retreino para o seu domínio — 500–5000 exemplos e no dia seguinte tem o seu modelo.
Streaming <200 ms
Stream SSE, TTFT ~200 ms. O utilizador vê a resposta de imediato, sem esperar 10 segundos de silêncio.
Prompt-cache
Os prompts de sistema repetidos e o contexto RAG ficam em cache. Menos 40% na fatura.
Modo batch
Um milhão de pedidos por noite — 50% mais barato do que os síncronos. Para auditorias e etiquetagem.
Guardrails & PII
Filtros de temas, proteção contra injeções, mascaramento de PII à entrada e à saída.
Embeddings
aist-embed-ru-v3, 1024-d, até 8K tokens. 2 ₽ / 1M. Para RAG e pesquisa.
Painel de utilização
Pedidos por chave, tokens, custo, erros, latência p50/p95/p99.
SDK & integrações
Python, Node, Go, Rust, .NET, 1C. Compatível com LangChain, LlamaIndex, AutoGen.
Pague apenas pelo que utiliza. Sem riscos cambiais.
Preços transparentes por tokens. Descontos por volume, modo batch, compra de reserved-capacity. Orçamentos por chaves e equipas — para que o CFO não se assuste com as faturas.
// tarifação
// modelos
// formas de pagamento
// sdk & plataformas
// regiões
// integração com os serviços AiST
Preços claros, previsíveis, empresariais.
Free-tier para começar (100 mil tokens no Pro). Desconto por volume e reserved-capacity. Para clientes empresariais — pagamento diferido por fatura, orçamentos por departamento, contrato único. Sem «surpresas noturnas» na fatura.
Pagamento de acordo com a utilização real. Começa com 100K tokens gratuitos e depois — segundo a tarifa.
Capacidade reservada com um desconto de 30–50%. Para cargas elevadas e estáveis.
Licença perpétua para implementar no seu perímetro. Sem faturação por tokens: paga apenas o seu próprio hardware.
Do chat empresarial a agentes em produção e modelos custom.
O LLM é a infraestrutura das aplicações de IA. Qualquer assistente, agente, motor de pesquisa, analítica ou chat seu vive sobre um LLM. É o bloco de construção básico sem o qual nada funciona.
Um ChatGPT empresarial no seu perímetro
Painel web, bot de Telegram, widget no 1C — os colaboradores conversam com o LLM sem que os dados fujam para a OpenAI. Todos os pedidos — sob auditoria, por perfis, em conformidade com a 152-FZ.
Code-assistant no IDE
aist-llm-code no VSCode, Cursor, JetBrains através da API padrão. Geração, refatoração, testes, revisão de PR. Conhece 1C, Python, TS e o seu legacy.
Backend para as suas funcionalidades de IA
Por baixo do seu produto — a nossa LLM-API. Assistente de chat, classificação, resumos, geração de descrições de produto. Uma API para todo o produto.
Modelo custom para o seu setor
Retreino com 5000 exemplos da sua terminologia (medicina, direito, oil & gas) — e o modelo responde «como o seu especialista». Qualidade no seu domínio — +20–40%.
Motor para o AiST Agent
Por baixo dos nossos agentes — o nosso próprio LLM. Function-calling, JSON-mode, contexto longo, baixa latência. Um agente de 100 passos termina em 3 minutos.
Processamento batch de milhões de registos
«Classifique 10 milhões de avaliações», «resuma 1 milhão de chamadas», «extraia os factos de 500 000 contratos» — a batch-API é 50% mais barata e termina numa noite.
Os modelos próprios são a base de todos os outros serviços da AiST.
Cada serviço da AiST utiliza por baixo os nossos próprios LLM. O RAG gera respostas com o Pro, o Dialog conversa com o Light, o Agent trabalha com o Pro e function-calling, o OCR usa ainda o Vision. Ao contratar o AiST LLM — tem todo o ecossistema ao alcance da mão.
Não é só uma API. É todo o ecossistema AiST.
Pode contratar apenas a API e construir o que é seu. Ou usar diretamente os serviços prontos sobre o LLM: RAG para pesquisar em documentos, Agent para tarefas autónomas, Dialog para atender os clientes. Um único painel, uma única fatura, moderação e auditoria unificadas.
«Usávamos o GPT-4 através de VPN, preocupados todos os dias com a lei federal russa 152-FZ. Passámos para o aist-llm-pro — a qualidade revelou-se superior, fatura transparente, sem VPN nem riscos jurídicos»
O que mais oferece a AiST Platform→LLM sem VPN e sem riscos jurídicos: 152-FZ e contrato local.
O GPT-4 através de VPN viola as condições de utilização da OpenAI e representa um risco potencial face à 152-FZ. O AiST LLM resolve ambos os problemas: os modelos no seu perímetro, faturação transparente, contrato em conformidade com a legislação local.
Perímetro fechado
- On-prem ou AiST BOX no seu centro de dados
- Variante air-gapped para infraestruturas críticas
- Os pedidos não saem para o estrangeiro
- RBAC: chaves por equipa, scopes por modelo
- Proteção contra prompt-injection à entrada
- Exportação para o SIEM de cada pedido
Segurança jurídica
- 152-FZ — dados pessoais no seu perímetro
- Contrato sob jurisdição local
- Sem VPN nem violações de ToS
- Inscrito no registo nacional de software
- Certificação FSTEC (em curso)
- Compatível com STR-K
Despesas transparentes
- Faturação sem riscos cambiais
- Orçamentos por chaves e equipas
- Cache e batch — menos 40–50% na fatura
- Reserved capacity com um desconto de 30–50%
- Pagamento diferido por fatura para B2B
- Documentação de fecho segundo a norma local
O que costumam perguntar-nos antes de migrar da OpenAI.
A qualidade não é mesmo inferior ao GPT-4 / Claude?
O aist-llm-pro está ao nível do Claude Sonnet e do GPT-4o e, em vários domínios (textos jurídicos, 1C, relatórios administrativos), é notoriamente mais preciso, porque foi treinado tendo em conta essas especificidades. Mostramos-lhe um benchmark com as suas próprias tarefas numa semana de piloto.
Quanto tempo demora a migração da OpenAI?
5 minutos para o código. Altere o `base_url` do OpenAI SDK para `https://api.aist.ai/v1` e o nome do modelo para `aist-llm-pro` — e tudo funciona. Streaming, function-calling e JSON-mode são compatíveis um a um.
É possível implementar o modelo no nosso centro de dados?
Sim, a versão on-prem é fornecida para Pro, Light, Code, Vision e Embed. Calculamos o dimensionamento de GPU de acordo com o seu tráfego (normalmente 1–4 H100 para uma empresa média). A entrega air-gapped é feita em suporte físico, sem internet.
É mesmo possível afinar o modelo com a nossa terminologia?
Sim. No mínimo 500 exemplos de qualidade «pergunta-resposta» no seu estilo. O ideal — 2000–5000. Num dia — o seu modelo custom através da mesma API. Pode manter vários modelos fine-tuned em simultâneo, para diferentes equipas.
Quanto custaria com a nossa carga?
Calculamos de acordo com o seu perfil de pedidos. Como referência: uma empresa média com 1000 colaboradores e chat empresarial — ~50–150 mil ₽/mês no Pro com cache. Para cargas elevadas, a reserved capacity oferece 30–50% de desconto. Para air-gapped — licença única + o seu próprio hardware.
Podemos usar apenas o LLM ou é preciso contratar toda a plataforma?
Pode contratar apenas a LLM-API — é um produto completo. Mas a verdadeira potência surge em combinação com RAG (pesquisa em documentos), Agent (tarefas autónomas), Dialog (widget e mensagens), OCR/ASR/Image. Um único painel, uma única fatura, auditoria unificada.
Obtenha uma chave de API em 5 minutos e meça a qualidade com os seus próprios pedidos.
Registe-se — receba uma chave e 100 mil tokens gratuitos no aist-llm-pro. Teste os seus prompts e compare com o GPT-4 ou o Claude. Decida com base em números.