Chatten Sie mit KI-Modellen, die vollständig auf Ihrem Desktop laufen. Kein Internet erforderlich, keine Daten verlassen Ihr Gerät.
Erste Schritte
1. Ein Modell herunterladen
DeskLLM benötigt ein Sprachmodell, um zu funktionieren. Klicken Sie beim ersten Start auf das Download-Symbol in der unteren Symbolleiste, um den Model Manager zu öffnen.
Recommend tab — Wählen Sie ein Modell, das zu Ihrem Computer passt:
| Kategorie | RAM | Geeignet für |
|---|---|---|
| Ultra Light | 4 GB+ | Schnelle Antworten, minimale Ressourcen |
| Light | 8 GB+ | Alltägliche Aufgaben, Hintergrund-Assistent |
| Standard | 16 GB+ | Chat, Schreiben, Zusammenfassung |
| High-End | 32 GB+ | Komplexes Schlussfolgern, Code-Generierung |
Klicken Sie auf Download auf einer beliebigen Modellkarte. Der Download-Fortschritt wird in Echtzeit angezeigt.
Browse tab — Suchen Sie auf Hugging Face per Stichwort nach einem beliebigen GGUF-Modell.
2. Mit dem Chatten beginnen
- Wählen Sie ein Modell aus dem Dropdown in der unteren Symbolleiste
- Klicken Sie auf das Lade-Symbol (das Modell wird beim ersten Senden automatisch geladen, wenn es noch nicht geladen ist)
- Geben Sie Ihre Nachricht ein und drücken Sie Return, um sie zu senden
- Die KI antwortet in Echtzeit, Token für Token
Übersicht der Oberfläche
Seitenleiste
Mit dem Hamburger-Symbol (oben links) ein- und ausschalten. Zeigt Ihre Chat-Sitzungen an.
- Klicken Sie auf eine Sitzung, um zu ihr zu wechseln
- Rechtsklick für Rename oder Delete
- Klicken Sie auf + New Chat, um eine neue Konversation zu starten
Chat-Bereich
- Ihre Nachrichten erscheinen rechts (farbige Sprechblasen)
- KI-Antworten erscheinen links
- Klicken Sie auf das Kopier-Symbol einer Nachricht, um sie in die Zwischenablage zu kopieren
- Drücken Sie Shift + Return für eine neue Zeile, ohne zu senden
Untere Symbolleiste
| Element | Beschreibung |
|---|---|
| Modell-Dropdown | Wählt aus, welches Modell verwendet wird |
| Download-Symbol | Öffnet den Model Manager |
| Laden / Entladen-Symbol | Lädt oder entlädt das aktuelle Modell manuell |
| Statusanzeige | Zeigt “Generating…” während der Antwort an |
Modellverwaltung
Mit dem Download-Symbol in der Symbolleiste öffnen.
- Downloaded tab — Listet alle Modelle auf Ihrer Festplatte auf. Löschen Sie Modelle, die Sie nicht mehr benötigen, um Speicher freizugeben.
- Recommend tab — Kuratierte Liste beliebter Modelle mit Ein-Klick-Download. Der Speicherplatzbedarf wird vor dem Download angezeigt.
- Browse tab — Suchen Sie direkt auf Hugging Face. Filtern Sie nach Namen und durchsuchen Sie verfügbare GGUF-Dateien für ein beliebiges Repository.
Wo Modelle gespeichert werden
| OS | Pfad |
|---|---|
| macOS | ~/Library/Application Support/DeskAssist/llm_models/ |
| Windows | %APPDATA%/DeskAssist/llm_models/ |
Einstellungen
Zugriff über das Zahnrad-Symbol (unten links) oder das App-Menü.
| Einstellung | Beschreibung | Standard |
|---|---|---|
| Temperature | Kreativitätsstufe (0.0 = fokussiert, 1.0+ = kreativ) | 0.7 |
| Max Tokens | Maximale Antwortlänge | 512 |
| Context Size | Wie viel Konversationsverlauf das Modell sieht | 2048 |
| System Prompt | Anweisungen, die dem Modell vor jeder Konversation gegeben werden | “You are a helpful assistant.” |
| API Enabled | Startet einen lokalen REST-API-Server | On |
| API Port | Portnummer für den API-Server | 8800 |
Die richtigen Einstellungen wählen
- Temperature — Niedriger (0.1–0.3) für faktenbasierte Antworten. Höher (0.7–1.0) für kreatives Schreiben.
- Max Tokens — Erhöhen Sie den Wert für längere Antworten. 512 ist für die meisten Konversationen geeignet.
- Context Size — Größere Werte ermöglichen es dem Modell, mehr von der Konversation zu behalten, benötigen aber mehr RAM.
REST API
DeskLLM betreibt einen lokalen API-Server, der mit dem OpenAI-Format kompatibel ist. Andere Anwendungen auf Ihrem Computer können ihn verwenden.
Endpoint: http://localhost:8800
Beispiel (curl)
curl http://localhost:8800/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"messages": [{"role": "user", "content": "Hello!"}],
"stream": true
}'
Beispiel (Python)
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8800/v1", api_key="none")
response = client.chat.completions.create(
model="local",
messages=[{"role": "user", "content": "Hello!"}]
)
print(response.choices[0].message.content)
Tastenkürzel
| Aktion | macOS | Windows |
|---|---|---|
| Fenster anzeigen / ausblenden | Ctrl + Cmd + F8 | Ctrl + Alt + F8 |
| Nachricht senden | Return | Return |
| Neue Zeile | Shift + Return | Shift + Return |
| Neuer Chat | Cmd + N | Ctrl + N |
Tipps
- Modelle frei wechseln — Sie können Modelle jederzeit mitten in einer Konversation wechseln.
- System prompt — Passen Sie ihn für verschiedene Anwendungsfälle an: Übersetzer, Programmierassistent, Schreibhilfe usw.
- Mehrere Sitzungen — Halten Sie getrennte Konversationen für unterschiedliche Themen. Die Seitenleiste erleichtert das Wechseln.
- Offline-Nutzung — Sobald ein Modell heruntergeladen ist, funktioniert DeskLLM vollständig offline.
- API-Integration — Verwenden Sie die integrierte API, um DeskLLM mit anderen Tools, Skripten oder Anwendungen auf Ihrem Rechner zu verbinden.
Fehlerbehebung
| Problem | Lösung |
|---|---|
| Modell lädt nicht | Verfügbaren RAM prüfen. Eine kleinere Quantisierung (Q4_K_M) verbraucht weniger Speicher. |
| Langsame Antworten | Versuchen Sie ein kleineres Modell. Schließen Sie andere speicherintensive Apps. |
| Unverständliche Ausgabe | Senken Sie die Temperatur. Versuchen Sie ein anderes Modell. |
| Download schlägt fehl | Internetverbindung prüfen. Erneut versuchen — Downloads werden automatisch fortgesetzt. |
| App startet nicht | Löschen Sie die Einstellungsdatei und starten Sie neu. |
Datenschutz
- Die gesamte KI-Verarbeitung erfolgt lokal auf Ihrem Computer
- Es werden keine Daten an externe Server gesendet
- Der Chat-Verlauf wird nur auf Ihrer lokalen Festplatte gespeichert
- Modelle werden von Hugging Face heruntergeladen (der einzige Netzwerkzugriff)