Tillbaka till tjänster

On-Premise AI-lösningar

Kör öppna språkmodeller på hårdvara ni själva kontrollerar. Vi tar hand om GPU-dimensionering, inferensservering och nätverksisolering, så att känslig data stannar innanför ert skalskydd och revisorerna får ett rakt svar.

  • Er hårdvara, er data
  • Kan köras helt offline
  • Data stannar i Sverige

Varför On-Premise AI?

Datasuveränitet & regelefterlevnad

Viss data kan inte skickas till ett moln-API. Försvarsmaterial, patientjournaler, banktransaktioner. Har juristerna redan sagt nej till moln-AI är frågan inte om ni ska köra modeller på egen infrastruktur, utan hur ni gör det bra.

  • Krav i försvarssektorn och säkerhetsskyddslagen
  • Patientdata enligt patientdatalagen och GDPR
  • Finansiell data enligt PSD2 och MiFID II
  • Data hos myndigheter och kommuner

Ingenting lämnar ert nätverk

Prompter, dokument och modellvikter stannar på era maskiner. Inga externa API-anrop, ingen telemetri till leverantörer, ingen träning på er data. För air-gappade miljöer designar och dokumenterar vi hur utgående trafik, telemetri, modelluppdateringar och supportåtkomst kontrolleras, så att isoleringen kan verifieras på nätverksnivå i stället för att bara påstås.

  • Air-gappad drift där klassningen kräver det
  • Fungerar helt utan internetanslutning
  • Varje anrop loggas för revision
  • Nätverksisolering med VLAN och brandväggszoner

Organisationer som behöver On-Premise AI

  1. Myndigheter & försvar

    Säkerhetsklassad information hamnar inte i ett publikt moln. Vi bygger AI-miljöer som klarar en säkerhetsgranskning: isolerade nätverk, kontrollerad hårdvara, dokumenterade dataflöden.

    Examples: Underrättelseanalys, försvarslogistik, säker kommunikation, hotdetektering, hantering av säkerhetsklassade dokument

  2. Sjukvård & life science

    Patientdatalagen och GDPR sätter hårda gränser för var patientdata får behandlas. En on-premise-modell kan läsa journalen utan att journalen någonsin lämnar sjukhuset.

    Examples: Kliniskt beslutsstöd, medicinsk bildanalys, läkemedelsutveckling, journalanalys, bearbetning av forskningsdata

  3. Finansiella tjänster

    Banksekretess och PSD2 ger inte vika för ett bekvämt API. Bedrägerimodeller och dokumentanalys körs intill datan, innanför det skalskydd ni redan försvarar.

    Examples: Bedrägeridetektering, kreditriskanalys, handelsalgoritmer, KYC/AML-screening, analys av finansiella dokument

Våra On-Premise AI-tjänster

Privat LLM-drift

  • Llama 4 (Scout / Maverick)
  • Mistral Medium 3.5 (öppna vikter)
  • OpenAI gpt-oss (120B / 20B)
  • DeepSeek V4 & GLM-5.2
  • Finjustering på er egen data
  • Modeller med bra stöd för svenska
  • Kvantisering (GPTQ/AWQ) anpassad till era GPU:er

Infrastruktur

  • Design av GPU-kluster (NVIDIA H100/H200/B200)
  • Kubernetes-orkestrering
  • Lastbalansering & autoskalning
  • Lagringsarkitektur (NVMe/SAN)
  • Nätverksoptimering (InfiniBand)
  • Backup & katastrofåterställning
  • Hög tillgänglighet med automatisk failover

Integration & API:er

  • OpenAI- och Anthropic-kompatibla API:er
  • Skräddarsydda REST/GraphQL-API:er
  • SDK-utveckling (Python/TypeScript)
  • Integration med era interna applikationer
  • Kopplingar mot äldre system
  • Autentisering (LDAP/AD/SAML)
  • API-gateway & rate limiting

Säkerhet & regelefterlevnad

  • Nätverkssegmentering & VLAN
  • Kryptering i vila och under transport
  • Rollbaserad åtkomstkontroll (RBAC)
  • Auditloggning & SIEM-integration
  • Penetrationstester
  • Efterlevnadsdokumentation till era revisorer
  • Härdning enligt CIS-benchmarks

Data & RAG-lösningar

  • Vektordatabaser (pgvector, Qdrant, Milvus)
  • Pipelines för dokumentinläsning
  • Embeddings genererade på lokala GPU:er
  • Semantisk sökning i era dokument
  • Integration med kunskapsgrafer
  • Gallringsregler som ni bestämmer
  • Backup & versionshantering av index

Drift & support

  • Övervakning & larm dygnet runt
  • Prestandatrimning när lasten växer
  • Modelluppdateringar & säkerhetspatchning
  • Kapacitetsplanering innan det tar stopp
  • Incidenthantering
  • Utbildning så att ert team kan driva själva
  • Managed service om ni hellre slipper

Teknikstack

LLM-modeller

  • Llama 4 (Meta)
  • Mistral Medium 3.5
  • OpenAI gpt-oss
  • DeepSeek V4 / GLM-5.2

Inferens & servering

  • vLLM
  • TGI (Text Generation Inference)
  • TensorRT-LLM
  • Triton Inference Server

Orkestrering

  • Kubernetes
  • Docker
  • Helm Charts
  • ArgoCD (GitOps)

Hårdvara

  • NVIDIA H100 / H200
  • NVIDIA B200
  • AMD MI300X / MI325X
  • InfiniBand-nätverk

Vektordatabaser

  • Qdrant
  • Milvus
  • Weaviate
  • pgvector (PostgreSQL)

Övervakning

  • Prometheus
  • Grafana
  • Elasticsearch/Kibana
  • Nvidia DCGM

Säkerhet

  • Vault (HashiCorp)
  • cert-manager
  • Falco (runtime-säkerhet)
  • Trivy (sårbarhetsskanning)

Utveckling

  • LangChain
  • LlamaIndex
  • Hugging Face Transformers
  • FastAPI/Python

Redo att köra AI på egen hårdvara?

Boka ett tekniskt samtal. Ta med era säkerhetskrav och ungefärliga volymer, så skissar vi en arkitektur, föreslår modeller och hårdvara och ger en ärlig bild av kostnad och arbetsinsats.