On-Premise AI-lösningar
Kör öppna språkmodeller på hårdvara ni själva kontrollerar. Vi tar hand om GPU-dimensionering, inferensservering och nätverksisolering, så att känslig data stannar innanför ert skalskydd och revisorerna får ett rakt svar.
- Er hårdvara, er data
- Kan köras helt offline
- Data stannar i Sverige
Varför On-Premise AI?
Datasuveränitet & regelefterlevnad
Viss data kan inte skickas till ett moln-API. Försvarsmaterial, patientjournaler, banktransaktioner. Har juristerna redan sagt nej till moln-AI är frågan inte om ni ska köra modeller på egen infrastruktur, utan hur ni gör det bra.
- Krav i försvarssektorn och säkerhetsskyddslagen
- Patientdata enligt patientdatalagen och GDPR
- Finansiell data enligt PSD2 och MiFID II
- Data hos myndigheter och kommuner
Ingenting lämnar ert nätverk
Prompter, dokument och modellvikter stannar på era maskiner. Inga externa API-anrop, ingen telemetri till leverantörer, ingen träning på er data. För air-gappade miljöer designar och dokumenterar vi hur utgående trafik, telemetri, modelluppdateringar och supportåtkomst kontrolleras, så att isoleringen kan verifieras på nätverksnivå i stället för att bara påstås.
- Air-gappad drift där klassningen kräver det
- Fungerar helt utan internetanslutning
- Varje anrop loggas för revision
- Nätverksisolering med VLAN och brandväggszoner
Organisationer som behöver On-Premise AI
Myndigheter & försvar
Säkerhetsklassad information hamnar inte i ett publikt moln. Vi bygger AI-miljöer som klarar en säkerhetsgranskning: isolerade nätverk, kontrollerad hårdvara, dokumenterade dataflöden.
Examples: Underrättelseanalys, försvarslogistik, säker kommunikation, hotdetektering, hantering av säkerhetsklassade dokument
Sjukvård & life science
Patientdatalagen och GDPR sätter hårda gränser för var patientdata får behandlas. En on-premise-modell kan läsa journalen utan att journalen någonsin lämnar sjukhuset.
Examples: Kliniskt beslutsstöd, medicinsk bildanalys, läkemedelsutveckling, journalanalys, bearbetning av forskningsdata
Finansiella tjänster
Banksekretess och PSD2 ger inte vika för ett bekvämt API. Bedrägerimodeller och dokumentanalys körs intill datan, innanför det skalskydd ni redan försvarar.
Examples: Bedrägeridetektering, kreditriskanalys, handelsalgoritmer, KYC/AML-screening, analys av finansiella dokument
Våra On-Premise AI-tjänster
Privat LLM-drift
- Llama 4 (Scout / Maverick)
- Mistral Medium 3.5 (öppna vikter)
- OpenAI gpt-oss (120B / 20B)
- DeepSeek V4 & GLM-5.2
- Finjustering på er egen data
- Modeller med bra stöd för svenska
- Kvantisering (GPTQ/AWQ) anpassad till era GPU:er
Infrastruktur
- Design av GPU-kluster (NVIDIA H100/H200/B200)
- Kubernetes-orkestrering
- Lastbalansering & autoskalning
- Lagringsarkitektur (NVMe/SAN)
- Nätverksoptimering (InfiniBand)
- Backup & katastrofåterställning
- Hög tillgänglighet med automatisk failover
Integration & API:er
- OpenAI- och Anthropic-kompatibla API:er
- Skräddarsydda REST/GraphQL-API:er
- SDK-utveckling (Python/TypeScript)
- Integration med era interna applikationer
- Kopplingar mot äldre system
- Autentisering (LDAP/AD/SAML)
- API-gateway & rate limiting
Säkerhet & regelefterlevnad
- Nätverkssegmentering & VLAN
- Kryptering i vila och under transport
- Rollbaserad åtkomstkontroll (RBAC)
- Auditloggning & SIEM-integration
- Penetrationstester
- Efterlevnadsdokumentation till era revisorer
- Härdning enligt CIS-benchmarks
Data & RAG-lösningar
- Vektordatabaser (pgvector, Qdrant, Milvus)
- Pipelines för dokumentinläsning
- Embeddings genererade på lokala GPU:er
- Semantisk sökning i era dokument
- Integration med kunskapsgrafer
- Gallringsregler som ni bestämmer
- Backup & versionshantering av index
Drift & support
- Övervakning & larm dygnet runt
- Prestandatrimning när lasten växer
- Modelluppdateringar & säkerhetspatchning
- Kapacitetsplanering innan det tar stopp
- Incidenthantering
- Utbildning så att ert team kan driva själva
- Managed service om ni hellre slipper
Teknikstack
LLM-modeller
- Llama 4 (Meta)
- Mistral Medium 3.5
- OpenAI gpt-oss
- DeepSeek V4 / GLM-5.2
Inferens & servering
- vLLM
- TGI (Text Generation Inference)
- TensorRT-LLM
- Triton Inference Server
Orkestrering
- Kubernetes
- Docker
- Helm Charts
- ArgoCD (GitOps)
Hårdvara
- NVIDIA H100 / H200
- NVIDIA B200
- AMD MI300X / MI325X
- InfiniBand-nätverk
Vektordatabaser
- Qdrant
- Milvus
- Weaviate
- pgvector (PostgreSQL)
Övervakning
- Prometheus
- Grafana
- Elasticsearch/Kibana
- Nvidia DCGM
Säkerhet
- Vault (HashiCorp)
- cert-manager
- Falco (runtime-säkerhet)
- Trivy (sårbarhetsskanning)
Utveckling
- LangChain
- LlamaIndex
- Hugging Face Transformers
- FastAPI/Python
Redo att köra AI på egen hårdvara?
Boka ett tekniskt samtal. Ta med era säkerhetskrav och ungefärliga volymer, så skissar vi en arkitektur, föreslår modeller och hårdvara och ger en ärlig bild av kostnad och arbetsinsats.