Naar inhoud
DienstenProjectenInvesteringAanpakOver LynuxisBlog Plan gesprek
Case · Developer-infrastructuur · Edge AI

EdgeWeave — één endpoint, vijf AI-providers, slimste route wint

AI-applicaties worden met de week duurder en de provider-prijzen drijven uit elkaar. Wie zijn requests naar OpenAI stuurt voor alles, betaalt 3-10× te veel voor wat Groq of Mistral net zo goed kunnen. EdgeWeave is een AI-router op Cloudflare Workers die per request beslist welke provider de slimste keus is op kosten + latency + actuele modelprestatie. Eén unified endpoint, type-safe SDK, OpenAPI-spec, Stripe usage-based metering en globale edge-deployment.

TypeEigen Lynuxis-product · dev-infra
Doorlooptijd8 weken MVP
TeamLudi (solo)
StatusMVP · pilot dev-team's
5
Providers — OpenAI · Anthropic · Groq · Mistral · Replicate
<30ms
Edge-overhead op proxy
−43%
Typische kosten-reductie
Stripe usage-based billing

Het probleem

Vijf provider-accounts, geen zicht op wat optimaal is

Een typische AI-app gebruikt nu drie tot vijf LLM-providers. OpenAI voor zware redenering, Anthropic voor lange context, Groq voor snelle classification, Mistral voor europese data-sovereignty, Replicate voor image/audio.

Maar het echte werk — beslissen welke provider per request — gebeurt zelden in productie. De meeste teams hard-coden de keuze en betalen er 2-5× voor wat ze achteraf gezien hadden kunnen besparen.

Plus: API-keys lekken, rate-limits zijn per-provider, retry-logic dupliceert zich, en het is moeilijk om met meerdere providers type-safe te werken — elke heeft z'n eigen response-schema.

Onze aanpak

Eén endpoint dat per request slim kiest

EdgeWeave draait op Cloudflare Workers. Edge-deployment betekent dat de router fysiek dichtbij de gebruiker zit — <30ms toegevoegde latency vergeleken met direct providers aanroepen.

De routing-logica weegt drie signalen per request: actuele provider-prijs per token (live van provider-pricing-pages), real-time latency per regio (rolling p95 over de laatste 1.000 calls), en kwaliteit voor het type taak (classificatie / generatie / lang context / image / audio).

Output is type-safe: één response-schema, ongeacht welke provider eronder zat. Een eigen SDK-generator bouwt typed clients voor TypeScript, Python en Go op basis van OpenAPI 3.1.

Caching via Upstash Redis (global edge). Usage-logs naar Turso (libsql, edge-native). Billing via Stripe met usage-based metering — klanten betalen per 1k tokens, ongeacht welke provider de request afhandelde.

Routing-beslissing · live

Vijf opties — Groq wint, beslist in 12ms

Voorbeeld: een classification-request "Detect language of this paragraph". Alle vijf providers kunnen het, maar de prijs verschilt 65×.

edgeweave.api · POST /v1/chat · routing 12ms · region: ams1
Inkomende kandidaten
OpenAI gpt-4o-mini$0.15/M320ms
Anthropic claude-haiku$0.25/M280ms
Groq llama3-8b$0.05/M42ms
Mistral 8x7b$0.18/M240ms
Replicate llama-2-7b$0.32/M650ms
Groq wint — language-detection past bij snelle classifier
Score: prijs 0.95 × latency 0.91 × kwaliteit 0.78 = 0.67
prijs3.0× goedkoper
latency7.6× sneller
routing12 ms
Kosten-vergelijking · 30 dagen

Wat één klant in een maand bespaarde

Een typische SaaS met chat + summary + classification: zonder router €4.182, met EdgeWeave-routing €2.387 — 43% minder zonder kwaliteitsverlies (gemeten via eval-set).

edgeweave/dashboard · klant #1284 · juni '26

Kosten-verdeling per provider — juni

847.000 requests · €2.387 totaal · −43% vs single
Groq
62% van requests
€ 412
Mistral
18%
€ 318
OpenAI
12%
€ 982
Anthropic
6%
€ 624
Replicate
2%
€ 51
SDK · type-safe

Eén client — vijf providers eronder

Geen if-else per provider, geen verschillende response-schemas. Eén SDK, één call, EdgeWeave doet de rest.

app.ts · TypeScript · @edgeweave/sdk
Request
import { EdgeWeave } from "@edgeweave/sdk"; const ew = new EdgeWeave({ apiKey: process.env.EW_KEY, }); // Eén call — EW kiest provider const reply = await ew.chat({ task: "classify", prompt: "Detect language: '...'", prefer: "cheap", cache: true, }); console.log(reply.text); console.log(reply._routing);
Response — typed
{ "text": "Nederlands · 0.97", "usage": { "prompt_tokens": 24, "completion_tokens": 8, "cost_eur": 0.000016 }, "_routing": { "provider": "groq", "model": "llama3-8b", "region": "ams1", "latency_ms": 42, "cache_hit": false, "reasoning": "task=classify, prefer=cheap → groq cheapest+fastest" } }
Tech stack

Onder de motorkap

  • Edge runtimeCloudflare Workers — wereldwijde colo's
  • API frameworkHono v4 — minimal overhead, type-safe
  • Type safetyTypeScript strict + tRPC voor de dashboard
  • CacheUpstash Redis (global edge) — semantic prompt-cache
  • DatabaseTurso (libsql) — usage-logs, projects, API-keys
  • SDK-generatorOpenAPI 3.1 + custom codegen voor TS/Py/Go
  • DashboardNext.js 14 App Router + Tailwind + shadcn/ui
  • BillingStripe usage-based metering met aggregation-events
  • AnalyticsPostHog · Error: Highlight.io · CI: GitHub Actions + Wrangler
Slimme details

Wat het anders maakt

  • Semantic cacheBijna-identieke prompts hergebruiken — 30% extra besparing
  • Type-safe over providers heenEén response-schema, geen provider-quirks
  • Live prijs-feedProvider-pricing wordt automatisch up-to-date gehouden
  • Per-region routingVerzoeken uit AMS gaan via groq-ams, niet -us
  • Fallback bij provider-downTweede keuze pakt direct over zonder retry-loop in jouw code
  • Audit-log per requestVoor compliance: welke provider, welk model, welke regio

"De grootste ontdekking tijdens het bouwen van EdgeWeave: voor 70% van de typische SaaS-AI-calls is OpenAI overkill. Groq doet classification 7× sneller, Mistral handelt EU-data zonder uitleg te hoeven geven. De router maakt die keuze automatisch — en dat scheelt onmiddellijk geld."

— Eigen ontwerp-notitie, Lynuxis bouw-log

Slimmere AI-routing in je SaaS?

Of je nu één SaaS bouwt of een hele lijn met AI-features — een type-safe router scheelt direct 30-50% op je AI-rekening en geeft je vrije keuze van provider per request.