Modelle · Offene Gewichte
Meta legt sein bestes Modell als Destillat unter Apache 2.0 offen — 30 Milliarden Parameter, ein Laptop
Meta hat am 10. August Muse Glimmer veröffentlicht, ein Sprachmodell mit rund 30 Milliarden Parametern, das ausdrücklich für den Betrieb auf eigener Hardware gebaut ist. Die Ankündigung im Meta-Research-Blog beschreibt es als klein genug, um „on a Mac or PC with a single consumer GPU“ zu laufen. Getestet hat Meta nach eigenen Angaben auf MacBooks mit M4-Max und M5-Max sowie auf einer GeForce RTX 5090 mit 32 GB Speicher.
Die technisch wie wirtschaftlich wichtigste Angabe steht allerdings nicht in den Benchmark-Tabellen, sondern in der Fußzeile: Das Modell steht unter der Apache-2.0-Lizenz. Wer die Tragweite einordnen will, muss sich ansehen, was Meta damit aufgibt. Die bisherigen Llama-Modelle liefen unter der hauseigenen Llama Community License, die kommerzielle Nutzung nur unterhalb einer Schwelle von 700 Millionen monatlich aktiven Nutzern erlaubte und Namens- sowie Kennzeichnungsauflagen enthielt. Apache 2.0 kennt nichts davon: keine Umsatz- oder Nutzerschwelle, keine Branding-Pflicht, keine Acceptable-Use-Policy als Lizenzbestandteil. Es ist dieselbe Lizenz, unter der Apache-Webserver oder Kubernetes stehen. Für Unternehmen, die bislang aus lizenzrechtlicher Vorsicht um Llama herumgebaut haben, fällt damit ein Prüfschritt weg.
Wichtig ist die Abgrenzung, die auch hier gilt und die wir an dieser Stelle vergangene Woche ausführlich behandelt haben: Apache 2.0 bezieht sich auf die veröffentlichten Gewichte. Trainingsdaten und der vollständige Trainings-Stack bleiben unveröffentlicht. „Open Source“ im Sinne der OSI-Definition ist das nicht, offene Gewichte mit einer wirklich freien Nutzungslizenz aber sehr wohl — und das ist gegenüber der Llama-Praxis eine echte Verschiebung, keine Marketingnuance.
Interessant ist, wie das Modell entstanden ist. Glimmer ist keine eigenständige Neuentwicklung, sondern ein Destillat. Meta schreibt: „We trained Muse Glimmer on Muse Spark's outputs using logit distillation, leveraging a similar data mix as the teacher.“ Destillation bedeutet, vereinfacht gesagt: Ein kleines Modell lernt nicht aus rohen Texten, sondern imitiert die Ausgaben eines großen. Beim Logit-Verfahren kopiert das kleine Modell dabei nicht nur die fertige Antwort, sondern die gesamte Wahrscheinlichkeitsverteilung über mögliche nächste Wörter — es lernt also auch, welche Alternativen das große Modell für knapp unterlegen hielt. Das überträgt deutlich mehr Information als reines Nachtrainieren auf generierten Text.
Der Lehrer in diesem Verhältnis ist Muse Spark, Metas größeres und weiterhin geschlossenes Flaggschiff — jenes Modell, über das wir am 7. August im Zusammenhang mit einem fehlkonfigurierten Cyber-Test berichtet haben. Glimmer ist damit die offene Ausgabe des besten Modells, das Meta hat, und nicht ein separat entwickeltes Nebenprodukt. Welche Versionsnummer von Spark als Lehrer diente, nennt der Meta-Blogpost nicht; wir geben deshalb keine an.
Zur Architektur: Es handelt sich um ein dichtes Modell (englisch dense), bei dem für jedes erzeugte Token sämtliche Parameter aktiv sind — im Unterschied zu den derzeit verbreiteten Mixture-of-Experts-Modellen, die pro Token nur einen Bruchteil ihrer Gewichte anschalten. Für den lokalen Betrieb ist das eine bewusste Entscheidung: Dichte Modelle sind bei gleicher Parameterzahl langsamer, aber im Speicherbedarf berechenbar und deutlich einfacher zu quantisieren. Genau darauf zielt das Angebot. In voller BF16-Präzision belegt Glimmer rund 55 GB, in aggressiver 4-Bit-Quantisierung unter 20 GB — erst damit passt es auf die genannten Consumer-Karten. Das Kontextfenster liegt bei gut 130.000 Token.
Positioniert ist das Modell als Agenten-Modell: Werkzeugaufrufe, mehrstufiges Vorgehen, Fehlerkorrektur, Verarbeitung von Screenshots und Dokumenten. Metas eigene Messungen weisen es bei agentischen Aufgaben vor den Vergleichsmodellen Qwen3.6-27B und Gemma4-31B aus, in anderen Disziplinen liegt es hinter ihnen. Diese Zahlen stammen sämtlich aus Metas eigener Modellkarte und Methodik; eine unabhängige Nachmessung durch Dritte lag zum Redaktionsschluss nicht vor. Dasselbe gilt für den von Nvidia genannten Durchsatz von über 20.000 Token pro Sekunde und GPU auf Blackwell-Ultra-Hardware — das ist eine Herstellerangabe des Chipherstellers zum Modell eines Partners, also die denkbar interessengeleitetste Kombination.
Für Unternehmen ist die praktische Frage nicht, ob Glimmer irgendeinen Benchmark gewinnt, sondern was ein lokal betreibbares Agenten-Modell an Möglichkeiten eröffnet, die ein API-Modell nicht bietet. Drei Dinge ändern sich: Erstens verlassen die Daten das eigene Netz nicht — bei Verträgen mit Vertraulichkeitsklauseln, bei Patientendaten oder bei Quellcode unter NDA ist das oft der Unterschied zwischen „geht“ und „geht nicht“. Zweitens verschwinden die variablen Kosten; wer einen Agenten in einer Schleife über tausende Dokumente laufen lässt, zahlt Strom statt Token. Drittens gibt es keine Ratenbegrenzung und keinen Anbieter, der die Modellversion unter dem laufenden Prozess austauscht.
Dem stehen Kosten gegenüber, die in Ankündigungen selten auftauchen: Ein 30-Milliarden-Parameter-Modell auf 4 Bit heruntergerechnet ist nicht dasselbe Modell. Meta gibt die Qualitätseinbuße bei der aggressivsten Stufe mit rund einem Prozent an — auch das eine Herstellerangabe. Für vollständiges Fine-Tuning nennt die Modellkarte einen Cluster aus acht H100-GPUs mit je 80 GB. „Läuft auf dem Laptop“ gilt für die Inferenz, nicht für das Training. Wer das verwechselt, plant falsch.
- Meta AI Research — Introducing Muse Glimmer
- Hugging Face — Muse Glimmer 30B
- heise online — Meta veröffentlicht Muse Glimmer: Offenes 30-Milliarden-Parameter-Modell
- NVIDIA Developer Blog — Run Local Agentic AI Workflows with Meta's Muse Glimmer
- AI News — Meta Muse Glimmer brings local AI agents to consumer GPUs