데스크톱에서 완전히 실행되는 AI 모델과 채팅하세요. 인터넷이 필요 없고, 데이터가 기기를 떠나지 않습니다.
시작하기
1. 모델 다운로드
DeskLLM이 작동하려면 언어 모델이 필요합니다. 첫 실행 시 하단 도구 모음의 다운로드 아이콘을 클릭하여 Model Manager를 엽니다.
Recommend tab — 컴퓨터에 맞는 모델을 선택하세요:
| 카테고리 | RAM | 적합한 용도 |
|---|---|---|
| Ultra Light | 4 GB+ | 빠른 답변, 최소 리소스 |
| Light | 8 GB+ | 일상 작업, 백그라운드 도우미 |
| Standard | 16 GB+ | 채팅, 글쓰기, 요약 |
| High-End | 32 GB+ | 복잡한 추론, 코드 생성 |
모델 카드의 Download를 클릭하세요. 다운로드 진행 상황이 실시간으로 표시됩니다.
Browse tab — Hugging Face에서 키워드로 GGUF 모델을 검색하세요.
2. 채팅 시작
- 하단 도구 모음의 드롭다운에서 모델 선택
- 로드 아이콘 클릭 (로드되지 않은 경우 첫 메시지에서 자동 로드됨)
- 메시지를 입력하고 Return 키를 눌러 전송
- AI가 토큰 단위로 실시간 응답
인터페이스 개요
사이드바
햄버거 아이콘(왼쪽 상단)으로 토글합니다. 채팅 세션을 표시합니다.
- 세션을 클릭하여 전환
- 마우스 오른쪽 버튼을 클릭하여 Rename 또는 Delete
- + New Chat을 클릭하여 새 대화 시작
채팅 영역
- 내 메시지는 오른쪽에 표시됩니다 (색상 말풍선)
- AI 응답은 왼쪽에 표시됩니다
- 아무 메시지의 복사 아이콘을 클릭하여 클립보드로 복사
- 전송 없이 줄 바꿈을 하려면 Shift + Return을 누르세요
하단 도구 모음
| 요소 | 설명 |
|---|---|
| 모델 드롭다운 | 사용할 모델 선택 |
| 다운로드 아이콘 | Model Manager 열기 |
| 로드 / 언로드 아이콘 | 현재 모델을 수동으로 로드 또는 언로드 |
| 상태 라벨 | 응답 중 “Generating…” 표시 |
모델 관리
도구 모음의 다운로드 아이콘으로 엽니다.
- Downloaded tab — 디스크에 있는 모든 모델을 나열합니다. 더 이상 필요하지 않은 모델을 삭제하여 공간을 확보하세요.
- Recommend tab — 원클릭 다운로드가 가능한 인기 모델의 큐레이션 목록. 다운로드 전에 디스크 공간이 표시됩니다.
- Browse tab — Hugging Face를 직접 검색합니다. 이름으로 필터링하고 모든 저장소에서 사용 가능한 GGUF 파일을 탐색합니다.
모델 저장 위치
| OS | 경로 |
|---|---|
| macOS | ~/Library/Application Support/DeskAssist/llm_models/ |
| Windows | %APPDATA%/DeskAssist/llm_models/ |
설정
왼쪽 하단의 톱니바퀴 아이콘 또는 앱 메뉴에서 액세스합니다.
| 설정 | 설명 | 기본값 |
|---|---|---|
| Temperature | 창의성 수준 (0.0 = 집중, 1.0+ = 창의적) | 0.7 |
| Max Tokens | 최대 응답 길이 | 512 |
| Context Size | 모델이 보는 대화 기록의 양 | 2048 |
| System Prompt | 모든 대화 전에 모델에 제공되는 지침 | “You are a helpful assistant.” |
| API Enabled | 로컬 REST API 서버 시작 | On |
| API Port | API 서버용 포트 번호 | 8800 |
적합한 설정 선택
- Temperature — 사실 기반 답변의 경우 낮게(0.1–0.3). 창의적 글쓰기의 경우 높게(0.7–1.0).
- Max Tokens — 더 긴 응답을 위해 늘리세요. 대부분의 대화에는 512가 적합합니다.
- Context Size — 값이 클수록 모델이 더 많은 대화를 기억할 수 있지만 RAM을 더 사용합니다.
REST API
DeskLLM은 OpenAI 형식과 호환되는 로컬 API 서버를 실행합니다. 컴퓨터의 다른 앱에서 사용할 수 있습니다.
엔드포인트: http://localhost:8800
예제 (curl)
curl http://localhost:8800/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"messages": [{"role": "user", "content": "Hello!"}],
"stream": true
}'
예제 (Python)
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8800/v1", api_key="none")
response = client.chat.completions.create(
model="local",
messages=[{"role": "user", "content": "Hello!"}]
)
print(response.choices[0].message.content)
키보드 단축키
| 동작 | macOS | Windows |
|---|---|---|
| 창 표시 / 숨기기 | Ctrl + Cmd + F8 | Ctrl + Alt + F8 |
| 메시지 보내기 | Return | Return |
| 줄 바꿈 | Shift + Return | Shift + Return |
| 새 채팅 | Cmd + N | Ctrl + N |
팁
- 모델 자유롭게 전환 — 대화 중에 언제든 모델을 변경할 수 있습니다.
- 시스템 프롬프트 — 번역가, 코딩 도우미, 글쓰기 도우미 등 다양한 사용 사례에 맞게 사용자 지정하세요.
- 다중 세션 — 다른 주제에 대해 별도의 대화를 유지하세요. 사이드바를 통해 쉽게 전환할 수 있습니다.
- 오프라인 사용 — 모델이 다운로드되면 DeskLLM은 완전히 오프라인으로 작동합니다.
- API 통합 — 내장 API를 사용하여 DeskLLM을 컴퓨터의 다른 도구, 스크립트 또는 앱과 연결하세요.
문제 해결
| 문제 | 해결 방법 |
|---|---|
| 모델이 로드되지 않음 | 사용 가능한 RAM을 확인하세요. 더 작은 양자화(Q4_K_M)는 메모리를 덜 사용합니다. |
| 응답이 느림 | 더 작은 모델을 시도하세요. 메모리를 많이 사용하는 다른 앱을 닫으세요. |
| 출력이 깨짐 | temperature를 낮추세요. 다른 모델을 시도하세요. |
| 다운로드 실패 | 인터넷 연결을 확인하세요. 다시 시도하세요 — 다운로드는 자동으로 재개됩니다. |
| 앱이 시작되지 않음 | 설정 파일을 삭제하고 다시 실행하세요. |
프라이버시
- 모든 AI 처리는 컴퓨터에서 로컬로 수행됩니다
- 외부 서버로 데이터가 전송되지 않습니다
- 채팅 기록은 로컬 디스크에만 저장됩니다
- 모델은 Hugging Face에서 다운로드됩니다 (유일한 네트워크 액세스)