DeskLLM - Anleitung

Chatten Sie mit KI-Modellen, die vollständig auf Ihrem Desktop laufen. Kein Internet erforderlich, keine Daten verlassen Ihr Gerät.


Erste Schritte

1. Ein Modell herunterladen

DeskLLM benötigt ein Sprachmodell, um zu funktionieren. Klicken Sie beim ersten Start auf das Download-Symbol in der unteren Symbolleiste, um den Model Manager zu öffnen.

Recommend tab — Wählen Sie ein Modell, das zu Ihrem Computer passt:

KategorieRAMGeeignet für
Ultra Light4 GB+Schnelle Antworten, minimale Ressourcen
Light8 GB+Alltägliche Aufgaben, Hintergrund-Assistent
Standard16 GB+Chat, Schreiben, Zusammenfassung
High-End32 GB+Komplexes Schlussfolgern, Code-Generierung

Klicken Sie auf Download auf einer beliebigen Modellkarte. Der Download-Fortschritt wird in Echtzeit angezeigt.

Browse tab — Suchen Sie auf Hugging Face per Stichwort nach einem beliebigen GGUF-Modell.

2. Mit dem Chatten beginnen

  1. Wählen Sie ein Modell aus dem Dropdown in der unteren Symbolleiste
  2. Klicken Sie auf das Lade-Symbol (das Modell wird beim ersten Senden automatisch geladen, wenn es noch nicht geladen ist)
  3. Geben Sie Ihre Nachricht ein und drücken Sie Return, um sie zu senden
  4. Die KI antwortet in Echtzeit, Token für Token

Übersicht der Oberfläche

Seitenleiste

Mit dem Hamburger-Symbol (oben links) ein- und ausschalten. Zeigt Ihre Chat-Sitzungen an.

  • Klicken Sie auf eine Sitzung, um zu ihr zu wechseln
  • Rechtsklick für Rename oder Delete
  • Klicken Sie auf + New Chat, um eine neue Konversation zu starten

Chat-Bereich

  • Ihre Nachrichten erscheinen rechts (farbige Sprechblasen)
  • KI-Antworten erscheinen links
  • Klicken Sie auf das Kopier-Symbol einer Nachricht, um sie in die Zwischenablage zu kopieren
  • Drücken Sie Shift + Return für eine neue Zeile, ohne zu senden

Untere Symbolleiste

ElementBeschreibung
Modell-DropdownWählt aus, welches Modell verwendet wird
Download-SymbolÖffnet den Model Manager
Laden / Entladen-SymbolLädt oder entlädt das aktuelle Modell manuell
StatusanzeigeZeigt “Generating…” während der Antwort an

Modellverwaltung

Mit dem Download-Symbol in der Symbolleiste öffnen.

  • Downloaded tab — Listet alle Modelle auf Ihrer Festplatte auf. Löschen Sie Modelle, die Sie nicht mehr benötigen, um Speicher freizugeben.
  • Recommend tab — Kuratierte Liste beliebter Modelle mit Ein-Klick-Download. Der Speicherplatzbedarf wird vor dem Download angezeigt.
  • Browse tab — Suchen Sie direkt auf Hugging Face. Filtern Sie nach Namen und durchsuchen Sie verfügbare GGUF-Dateien für ein beliebiges Repository.

Wo Modelle gespeichert werden

OSPfad
macOS~/Library/Application Support/DeskAssist/llm_models/
Windows%APPDATA%/DeskAssist/llm_models/

Einstellungen

Zugriff über das Zahnrad-Symbol (unten links) oder das App-Menü.

EinstellungBeschreibungStandard
TemperatureKreativitätsstufe (0.0 = fokussiert, 1.0+ = kreativ)0.7
Max TokensMaximale Antwortlänge512
Context SizeWie viel Konversationsverlauf das Modell sieht2048
System PromptAnweisungen, die dem Modell vor jeder Konversation gegeben werden“You are a helpful assistant.”
API EnabledStartet einen lokalen REST-API-ServerOn
API PortPortnummer für den API-Server8800

Die richtigen Einstellungen wählen

  • Temperature — Niedriger (0.1–0.3) für faktenbasierte Antworten. Höher (0.7–1.0) für kreatives Schreiben.
  • Max Tokens — Erhöhen Sie den Wert für längere Antworten. 512 ist für die meisten Konversationen geeignet.
  • Context Size — Größere Werte ermöglichen es dem Modell, mehr von der Konversation zu behalten, benötigen aber mehr RAM.

REST API

DeskLLM betreibt einen lokalen API-Server, der mit dem OpenAI-Format kompatibel ist. Andere Anwendungen auf Ihrem Computer können ihn verwenden.

Endpoint: http://localhost:8800

Beispiel (curl)

curl http://localhost:8800/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "messages": [{"role": "user", "content": "Hello!"}],
    "stream": true
  }'

Beispiel (Python)

from openai import OpenAI

client = OpenAI(base_url="http://localhost:8800/v1", api_key="none")
response = client.chat.completions.create(
    model="local",
    messages=[{"role": "user", "content": "Hello!"}]
)
print(response.choices[0].message.content)

Tastenkürzel

AktionmacOSWindows
Fenster anzeigen / ausblendenCtrl + Cmd + F8Ctrl + Alt + F8
Nachricht sendenReturnReturn
Neue ZeileShift + ReturnShift + Return
Neuer ChatCmd + NCtrl + N

Tipps

  • Modelle frei wechseln — Sie können Modelle jederzeit mitten in einer Konversation wechseln.
  • System prompt — Passen Sie ihn für verschiedene Anwendungsfälle an: Übersetzer, Programmierassistent, Schreibhilfe usw.
  • Mehrere Sitzungen — Halten Sie getrennte Konversationen für unterschiedliche Themen. Die Seitenleiste erleichtert das Wechseln.
  • Offline-Nutzung — Sobald ein Modell heruntergeladen ist, funktioniert DeskLLM vollständig offline.
  • API-Integration — Verwenden Sie die integrierte API, um DeskLLM mit anderen Tools, Skripten oder Anwendungen auf Ihrem Rechner zu verbinden.

Fehlerbehebung

ProblemLösung
Modell lädt nichtVerfügbaren RAM prüfen. Eine kleinere Quantisierung (Q4_K_M) verbraucht weniger Speicher.
Langsame AntwortenVersuchen Sie ein kleineres Modell. Schließen Sie andere speicherintensive Apps.
Unverständliche AusgabeSenken Sie die Temperatur. Versuchen Sie ein anderes Modell.
Download schlägt fehlInternetverbindung prüfen. Erneut versuchen — Downloads werden automatisch fortgesetzt.
App startet nichtLöschen Sie die Einstellungsdatei und starten Sie neu.

Datenschutz

  • Die gesamte KI-Verarbeitung erfolgt lokal auf Ihrem Computer
  • Es werden keine Daten an externe Server gesendet
  • Der Chat-Verlauf wird nur auf Ihrer lokalen Festplatte gespeichert
  • Modelle werden von Hugging Face heruntergeladen (der einzige Netzwerkzugriff)