Qwen-Scope: Sparse Autoencoder für Qwen3-Modelle veröffentlicht
Qwen hat mit Qwen-Scope ein Interpretierbarkeits-Modul für die Qwen3- und Qwen3.5-Modellreihe vorgestellt. Dabei kommen Sparse Autoencoders zum Einsatz, die in die versteckten Schichten der Modelle integriert werden und dort automatisch entkoppelte, interpretierbare Datenmerkmale extrahieren. Das hier beschriebene Checkpoint basiert auf Qwen3-1.7B-Base und deckt alle 28 Schichten ab, mit einer SAE-Breite von 32768 und jeweils 100 aktiven Merkmalen pro Durchlauf. Laut Angaben des Unternehmens eignet sich das Modul zur Analyse interner Modellmechanismen sowie für steuerbare Inferenz, Datenklassifizierung und Modelloptimierung.
Quelle: HuggingFace Qwen
ThemenAlibaba