MoE-Active-Parameters-Rechner
Eingaben
| Experten gesamt | 8 |
|---|---|
| Aktive Experten (Top-k) | 2 |
| Parameter pro Experte | 7 |
| Geteilte Parameter | 1 |
MoE-Active-Parameters-Rechner
Berechne die Gesamt- und aktive Parameterzahl eines Mixture-of-Experts-Modells aus der Expertenzahl, dem Top-k-Routing, der Größe je Experte und den geteilten Gewichten — und trenne so den Speicherbedarf von der Rechenlast pro Token.
Eingaben
Modell
Ergebnisse
Geben Sie einen Wert ein, um die Ergebnisse zu sehen.
Details
Aktive MoE-Parameter
Ein Mixture-of-Experts-Modell trägt ein auffälliges Zahlenpaar: eine große Gesamtparameterzahl, die beschreibt, wie viel es fassen kann, und eine viel kleinere aktive Zahl, die beschreibt, wie viel Arbeit es pro Token leistet. Die beiden werden oft verwechselt, beantworten aber verschiedene Fragen — die eine setzt die Speicherrechnung, die andere die Rechenrechnung. Dieser Rechner trennt sie aus der Expertenzahl, dem Top-k-Routing, der Größe je Experte und den geteilten Gewichten.
Wie ein Mixture of Experts aufgebaut ist
In einem dichten Transformer durchläuft jedes Token jedes Gewicht. Ein Mixture of Experts ersetzt den Feed-Forward-Block eines Layers durch viele parallele Experten und fügt einen kleinen Router hinzu, der für jedes Token nur die Top-k von ihnen auswählt. Der Rest des Modells — Attention, der Router, die Embeddings und mitunter ein geteilter Experte, der immer läuft — bleibt allen Tokens gemeinsam. Der Pfad eines Tokens berührt also die geteilten Gewichte und nur die Handvoll Experten, zu denen es geroutet wurde, während die übrigen Experten für dieses Token untätig bleiben.
Das entkoppelt zwei Größen, die sich in einem dichten Modell gemeinsam bewegen. Die Kapazität wächst mit der Zahl der Experten, weil mehr Experten mehr spezialisiertes Wissen speichern können. Die Rechenlast wächst nur mit den aktiven Experten, weil nur diese an einem gegebenen Token rechnen.
Die zwei Zahlen
Mit Experten insgesamt, aktiven pro Token, Parametern pro Experte und geteilten Parametern ergeben sich die Gesamt- und die aktive Zahl als
TAr=s+E⋅p=s+k⋅p=TAwobei die Gesamtzahl ist, die den Speicherbedarf bestimmt, die aktive Zahl, die die Rechenlast pro Token bestimmt, und der Anteil der Gewichte, den jedes Token berührt.
Rechenbeispiel
Betrachte ein Modell mit acht Experten von je sieben Milliarden Parametern, das zwei pro Token routet, zusätzlich zu einer Milliarde geteilten Parametern:
TAr=1+8×7=57 Milliarden=1+2×7=15 Milliarden=5715≈0,263=26,3%Das Modell hält 57 Milliarden Parameter, gibt aber Rechenlast aus, als wäre es ein 15-Milliarden-Parameter-Modell je Token — etwa ein Viertel der Gewichte ist auf einmal aktiv. Darin liegt der Reiz: die Kapazität eines 57-Milliarden-Modells nahezu zu den Kosten eines 15-Milliarden-Modells pro Token.
Der Speicher folgt weiterhin der Gesamtzahl
Der Haken ist, dass die Einsparungen bei der Rechenlast liegen, nicht beim Speicher. Weil jeder Experte für jedes Token gewählt werden kann und sich ein Batch von Tokens über viele Experten verteilt, müssen alle gleichzeitig resident sein — das Modell kann nicht vorhersagen, welche Experten ein künftiges Token braucht. Der Speicherbedarf skaliert also mit der Gesamtzahl , während nur die Rechenlast mit der aktiven Zahl skaliert. Ein Mixture-of-Experts-Modell ist daher groß im Hosting, aber günstig im Betrieb — die umgekehrte Balance gegenüber einem dichten Modell gleicher Kosten pro Token.
Die Gesamtzahl, die die Speicherseite treibt, lässt sich aus der Architektur mit dem Transformer-Parameterzahl-Rechner aufbauen, und der Speicher, der zum tatsächlichen Bereitstellen dieser Gewichte nötig ist, wird im VRAM-Rechner für LLM-Inferenz behandelt.
Häufig gestellte Fragen (FAQ)
Warum ein Mixture of Experts?
Ein Mixture of Experts erlaubt es einem Modell, seine Parameterzahl — und damit seine Kapazität, Wissen zu speichern — zu vergrößern, ohne dass die Rechenlast je Token entsprechend steigt. Der Router schickt jedes Token nur zu einer kleinen Zahl von Experten, sodass die Gleitkomma-Arbeit pro Token den aktiven Parametern folgt, nicht der Gesamtzahl.
Das macht es möglich, ein Modell mit weit mehr Parametern zu trainieren und zu betreiben als ein dichtes Modell gleicher Kosten pro Token.
Was ist der Unterschied zwischen Gesamt- und aktiven Parametern?
Gesamtparameter zählen jedes Gewicht im Modell: die geteilten Layer plus alle Experten. Aktive Parameter zählen nur die für ein einzelnes Token genutzten Gewichte: die geteilten Layer plus die wenigen Experten, die der Router auswählt. Die Gesamtparameterzahl bestimmt den Speicherbedarf, weil alle Experten verfügbar sein müssen, um gewählt werden zu können.
Die aktive Zahl bestimmt die Rechenlast und Latenz pro Token, weil nur die gerouteten Experten arbeiten.
Wenn nur wenige Experten pro Token laufen, warum skaliert der Speicher mit der Gesamtzahl?
Jeder Experte kann für jedes Token gewählt werden, und über einen Batch von Tokens werden viele verschiedene Experten genutzt, sodass alle gleichzeitig im Speicher resident sein müssen.
Das Modell kann nicht im Voraus wissen, welche Experten ein künftiges Token braucht. Folglich skaliert der Speicherbedarf mit der Gesamtparameterzahl, obwohl die Rechenlast für ein einzelnes Token nur mit der aktiven Zahl skaliert. Das ist der zentrale Kompromiss des Ansatzes: günstige Rechenlast, aber die vollen Gewichte müssen dennoch gehalten werden.
Haftungsausschluss
Dies ist eine Schätzung erster Ordnung, die einheitliche Expertengrößen annimmt und geteilte Gewichte als stets aktiv behandelt. Sie ignoriert Routing-Ungleichgewichte, das kleine Router-Netzwerk selbst und etwaige Duplizierung durch Expertenparallelität über Geräte hinweg. Nutze sie, um Entwürfe zu vergleichen, nicht als exakte Abrechnung.