Modelle · lokal (eigene GPU) · geprüft 2026-08-23

SenseNova U1.5 8B-MoT

SenseTime · Apache-2.0

Ein Modell, das Bilder erzeugt, bearbeitet UND versteht — in einer Architektur, ohne Vision-Encoder und ohne VAE. Es läuft seit dem 2026-08-23 auf unserer eigenen Karte, unter echtem Apache-2.0, und es setzt deutsche Schlagzeilen fehlerfrei, obwohl die Modellkarte nur Englisch und Chinesisch verspricht. Kleine Schrift kann es nicht.

Anbieter
SenseTime
Tier
lokal (eigene GPU)
Lizenz
Apache-2.0
Gewichte
offen (self-hostbar)
Selbst betrieben
ja
Parameter
8 Mrd verstehen + 8 Mrd erzeugen (MoT)
Kontext
gemessen 2048×2048 bzw. 2368×1760
Modalitäten
Bild erzeugen · Bild verstehen
Aufgabe
Bild
Erschienen
2026-08-20
Unsere Sicht

Einschätzung

  • Die Lizenz ist geprüft, nicht geglaubt: die LICENSE-Datei ist auf beiden Zweigen byte-genau das Standard-Apache-2.0 von apache.org — einziger Unterschied ist eine führende Leerzeile. Keine Umsatzgrenze, kein Gebietsausschluss, keine Kündigungsklausel. Damit ist es rechtlich ruhiger als Krea 2 und gleichauf mit Qwen-Image-Edit. Achtung: das Gewichte-Repo auf Hugging Face enthält KEINE Lizenzdatei — der Vertrag reist nicht mit der Datei mit.
  • Bemerkenswert am eigenen Betrieb: es braucht kein Wartungsfenster. Der Lauf gelang mit nur ~5,8 GiB freiem VRAM, während vier andere Dienste ihre 18,8 GiB behielten. Es ist damit das erste grosse Bildmodell auf der Box, das NEBEN der Produktion läuft statt an ihrer Stelle.
  • Die Grenze verläuft exakt an der Schriftgrösse. Schlagzeilen sitzen mit Umlauten, Geviertstrich und Doppelpunkt fehlerfrei. Kleine Zeilen und viele Etiketten zerfallen — in einer Infografik mit sechs verlangten deutschen Beschriftungen waren vier richtig, eine falsch geschrieben, eine fehlte, zwei waren verdoppelt. Für unsere Hefte und Tafeln heisst das: Bild vom Modell, Beschriftung als echte Typografie darüber.
  • Es kann auch Fragen zu Bildern beantworten. Eine Szenenfrage zu einem Terrassenfoto wurde inhaltlich richtig beantwortet — aber in 163 Sekunden, mit einem sehr geschwätzigen Denk-Block davor. Zählen kann es nicht: die Frage nach der Stuhlzahl lief 262 Sekunden lang ins Leere und brach im Gedankengang ab. Als Ersatz für die Bild-Weiche in der US-Cloud ist es damit ein Kandidat für ruhige Beschreibungen, nicht für Zählen oder Echtzeit.
Stärken
  • Deutsche Schlagzeilen fehlerfrei — samt ü, ö, ä, Ö und Geviertstrich.
  • Szenentreue beim Bearbeiten deutlich über Qwen-Image-Edit (Details bleiben stehen).
  • Echtes Apache-2.0, byte-genau gegen apache.org geprüft.
  • Läuft neben der Produktion — kein Wartungsfenster nötig.
  • Verstehen und Erzeugen im selben Modell, ohne zweiten Stapel.
Grenzen
  • Kleine Schrift und viele Etiketten zerfallen — Infografiken unbrauchbar.
  • Erfindet Lichtquellen, wenn man welche verlangt; muss im Prompt verboten werden.
  • Bildfragen dauern 163–262 s; Zählen scheitert ganz.
  • Der `interleave`-Modus stürzt ab (NoneType in interleave_gen).
  • `think_mode` kostet +56 % Zeit und verschlechtert die Schrift.
  • Lokal nur als SFT-Stand quantisiert verfügbar, nicht als finale RL-Fassung.
Im Verein

Wo wir es einsetzen

  • ComfyUI auf der GPU-Box (Port 3164) — Bilderzeugung und Umbeleuchtung.
  • Umbeleuchtung von Kundenfotos: erstes Modell, das aus Tag wirklich Nacht macht.
Notizen

SenseNova U1.5 ist der Gegenfall zu Ideogram 4: dort ein technisch starkes Modell, das die Lizenz für uns verschliesst — hier eines, das offen ist und das wir tatsächlich betreiben.

Der Katalog führt es mit gemessenen Zahlen, nicht mit Herstellerangaben. Alle Werte hier stammen aus einer Reihe von Läufen auf unserer eigenen Karte am 2026-08-23: acht Bilder bei 28 Schritten in 2048×2048 brauchen je rund zweieinhalb Minuten, mit acht Schritten sind es 37 Sekunden — dann aber nur noch für Bilder mit grosser Schrift.

Der ehrlichste Befund ist die Grenze. Das Modell schreibt „Grüezi — Wörter für draussen“ fehlerfrei, obwohl seine eigene Modellkarte nur Englisch und Chinesisch nennt. Zwei Schriftgrade kleiner wird daraus „Teilnahme kostentols“. Wer das weiss, kann damit arbeiten; wer es nicht weiss, druckt einen Fehler.

Ein Steckbrief sagt, was ein Modell ist. Welches Modell eine konkrete Aufgabe gewinnt, entscheiden wir nicht aus dem Bauch, sondern messen es — Qualität gegen Kosten, pro Operation.