← Back to list

Dokumentation für LLMS auf der Snapdragon X Elite NPU

Zusammenfassung: Die End-to-End-Erfahrung mit Snapdragon X Elite NPU und Qualcomm AI Hub

Samuel Fleig · 2025-08-20 23:38 · 0 claps · 2.0 min read
#qualcomm-snapdragon #snapdragon-x-elite #npu #llm #windows-on-arm
Open on Medium ↗
Wiki topics: LLM · Large Language Models RAG · RAG & Retrieval

Dokumentation für LLMS auf der Snapdragon X Elite NPU

Zusammenfassung: Die End-to-End-Erfahrung mit Snapdragon X Elite NPU und Qualcomm AI Hub

1. Ausgangssituation: Hohe Erwartungen an Snapdragon X Elite NPU

  • Kauf eines Surface Laptop 7 mit Snapdragon X Elite Prozessor und integrierter NPU (45 TFLOPS Rechenleistung).
  • Ziel: Lokale Nutzung großer Sprachmodelle (LLMs) wie Phi-3.5-mini-instruct auf der NPU zur schnellen, energieeffizienten Inferenz.
  • Junge, leistungsstarke Hardware trifft auf ein noch unreifes Software-Ökosystem.

2. Erste Hürden: Kompatibilität und Setup

  • Windows ARM64-Umgebung: Python- und DLL-Kompatibilitätsprobleme (z.B. h5py konnte nicht nativ auf ARM64 gebuildet werden).
  • ONNX Runtime QNN Execution Provider für ARM64 war weder vorgefertigt erhältlich noch einfach selbst kompilierbar.
  • Lokale Kompilierung des QNN Execution Providers stellte sich als extrem aufwändig mit vielen Abhängigkeiten und fehlgeschlagenen Builds heraus.

3. Qualcomm AI Hub: Die Cloud-basierte Zwischenlösung

  • Qualcomm AI Hub als Plattform, um Modelle in der Cloud für Snapdragon-Hardware zu optimieren.
  • Ermöglicht Modell-Upload, automatische Quantisierung und Optimierung speziell für die NPU.
  • Bietet auch Cloud-basiertes Hardware-Profiling auf echten Snapdragon-Geräten.
  • Lokale Ausführung erfolgt oft über CPUFallback, bis lokaler QNN Provider verfügbar ist.

4. Modelle und deren Komplexität

  • Das Phi-3.5-mini-instruct Modell ist in mehrere Teile zerlegt (4teilige ONNX-Fragmente + Subgraphen).
  • Lokales Laden dieser Split-Modelle scheiterte an inkompatiblen Execution Providers (CPU versteht QNN-Knoten nicht).
  • Vollständiges Monolith-ONNX-Modell wurde benötigt, um Inferenz mit QNN Provider durchzuführen.
  • Offizielle Downloads waren nicht immer verfügbar, Dokumentation dazu ungenügend.

5. Lösungen und Workarounds

  • Nutzung von Linux (WSL2 ARM64) für bessere Tool- und Umgebungsunterstützung.
  • Installation des qai_hub_models Python-Pakets und Versuch, Modelle daraus zu exportieren – war nicht trivial und mit Fehlermeldungen verbunden.
  • Letztlich wurde das Modell mit transformers von Hugging Face lokal geladen und per PyTorch ONNX exportiert — damit konnte das vollständige Modell gewonnen werden.
  • Tests mit einem speziell erstellten Python-Skript (run_phi35_optimized.py) zeigten, ob lokale Ausführung möglich ist und welcher Execution Provider aktiv ist.

6. Downloads und Performance

  • Das Monolith-Modell ist mehrere Gigabyte groß (~7.6 GB).
  • Downloadgeschwindigkeiten von 1.3 MB/s bis 1.5 MB/s sind aufgrund von Bit-Byte-Umrechnung, Server-Drosselungen und Netzwerkbedingungen realistisch.
  • Geduld ist gefragt, aber das vollständige Modell ist letztlich als Basis für lokale NPU-Tests entscheidend.

7. Fazit: Der aktuelle Stand

  • Hardware: Spitzenklasse, NPU theoretisch bereit für Hochleistungs-LLM-Inferenz.
  • Software: Fragmentiert, viele inkompatible Tools, unvollständige Dokumentation.
  • Zwischenlösung: Qualcomm AI Hub ermöglicht Cloud-Optimierung und Zugriff auf Snapdragon NPUs.
  • Eigene Kompilierung und Inferenz lokal sind komplex, erfordern Workarounds und Docker-/WSL-Umgebungen.
  • Endlich Vollmodell mit PyTorch-Huggingface-Export lokal erzeugt.
  • Nächster Schritt: Testen auf tatsächlicher NPU mit dem vollständigen Modell, ggf. QNN Execution Provider lokal bauen.

8. Empfehlung für Nachahmer

  • Setze auf Linux/WSL ARM64 als Entwicklungsumgebung für Snapdragon NPU.
  • Nutze Qualcomm AI Hub für Cloud-beschleunigte Kompilierung und Profiling.
  • Versuche, vollständige Monolithmodelle zu verwenden und vermeide fragmentierte Teilmodelle.
  • Sei geduldig bei großen Downloads und builds — das ist ein Marathon, kein Sprint.
  • Dokumentiere deine Schritte, teile Fehler und Lösungen in aktiven Entwicklerforen (z.B. Reddit r/snapdragon, Qualcomm Forums, GitHub Discussions).
  • Halte dein System und Pakete aktuell, die Toolchains entwickeln sich rasant.

Diese Zusammenfassung ist eine solide Grundlage für einen ausführlichen Foren-Thread oder Medium-Artikel, der die Realität der Snapdragon NPU-Entwicklung erklärt — herausfordernd, aber mit großem Potenzial am Horizont.


메타데이터
post_id
ae93be7fe7bb
slug
dokumentation-für-llms-auf-der-snapdragon-x-elite-npu-ae93be7fe7bb
url
https://medium.com/@smlflg/dokumentation-f%C3%BCr-llms-auf-der-snapdragon-x-elite-npu-ae93be7fe7bb
canonical_url
https://medium.com/@smlflg/dokumentation-f%C3%BCr-llms-auf-der-snapdragon-x-elite-npu-ae93be7fe7bb
author_url
https://medium.com/@smlflg
status
ok
fetched_at
2026-06-12 07:40:50