Messungen ·mana-Hub ·Analyse ·geprüft 2026-06-05
Welches Modell leitet aus einer Cross-App-Aktivitäts-Timeline echte, konkrete Einsichten ab?

Muster aus der Timeline lesen: hier zahlt sich Frontier aus

Die ehrliche Gegenprobe: eine wirklich analytische Aufgabe. Hier brechen die lokalen und günstigen Modelle ein — nur die teuren Frontier-Modelle (GPT-5.5, Claude Opus) erreichen die Schwelle. Mehr Geld lohnt sich also doch — aber nur hier.

Empfehlung
Frontier gpt-5.5 (Frontier) Qualität 0.90 $0,071
günstigstes Modell ≥ Schwelle 0.85 bei erfüllten Format-Checks
Leaderboard · 12 Modelle
ModellQualitätFormatKostenok?
Frontier gpt-5.5 Empfehlung — das Reasoning-Modell glänzt hier endlich 0.90 100% $0,071
Frontier claude-opus-4.8 0.88 100% $0,088
China glm-5 knapp daneben (1 Schema-Fail) — günstige Alternative, 8× billiger 0.89 75% $0,009
Frontier gemini-3.1-pro-preview 0.82 100% $0,063
China deepseek-v4-pro 0.78 100% $0,003
Frontier gemini-2.5-flash 0.78 100% $0,001
EU-Cloud mistral-small 0.76 100% $0,002
China qwen3.7-max 0.73 100% $0,034
EU-Cloud mistral-large 0.70 75% $0,017
lokal gemma3:12b lokal reicht für echte Analyse nicht 0.53 100% 0 €
on-device gemma3:4b 0.51 100% 0 €
Frontier gemini-3.5-flash 0.45 100% $0,010

Methodik: 4 Fälle · Judge-Panel (Median): gemini-2.5-flash, deepseek-v4-pro, mistral-small. „Format" = deterministische Hard-Checks (gültiges Schema etc.). Die Judge-Modelle stehen selbst im Feld — ein Modell benotet sich nie selbst (Self-Ausschluss), aber Panel und Kandidaten überlappen, eine Peer-Bevorzugung ist nicht ausgeschlossen. Quelle: services/mana-evals.

Was wir sehen

Der mana-Hub kann aus deiner App-übergreifenden Aktivität — Mahlzeiten, gelesene Artikel, Stimmungen, gehörte Songs — kurze, konkrete Einsichten ableiten („du loggst Frühstück nur werktags“, „an niedergeschlagenen Tagen hörst du dreimal so lange Musik“). Das ist echte Analyse, kein Umformulieren.

Und hier kippt das Bild. Die lokalen Modelle brechen ein (0,51–0,53): sie produzieren generische Floskeln statt daten-belegter Muster. Die günstigen Clouds bleiben mittelmäßig (0,73–0,78). Nur die teuren Frontier-Modelle — GPT-5.5 (0,90) und Claude Opus (0,88) — erreichen die Schwelle.

Das ist der ehrliche Teil der Geschichte: Souveränität heißt nicht, dass das lokale Modell immer reicht. Für die einfachen, häufigen Aufgaben tut es das — und das ist der Großteil. Aber für die wenigen, wirklich analytischen Aufgaben verdient das Frontier seinen Preis. Genau deshalb messen wir pro Operation, statt pauschal zu entscheiden. Spannend am Rand: das chinesische glm-5 liegt mit 0,89 für ein Zehntel des Preises knapp dahinter.

Ehrlich benannt

Der Gegenpunkt

Wichtige Selbstkritik: das Judge-Panel besteht aus Modellen, die diese Aufgabe selbst nur mittelmäßig lösen (0,76–0,78). Dass sie die stärkeren Modelle dennoch oben einordnen, ist beruhigend — aber gerade für analytische Aufgaben gehört ein starker Judge ins Panel oder eine menschliche Eichung. n=4. Das Ergebnis ist belastbar genug für die Richtung, nicht für die zweite Nachkommastelle.