Twój lokalny AI,
wreszcie pod kontrolą
Llama Control to pulpit zarządzania dla llama.cpp. Zarządzaj modelami GGUF, rozmawiaj z AI, testuj wydajność, automatycznie stroj flagi serwera i przeglądaj HuggingFace, wszystko w jednym interfejsie.
Gotowe w 4 krokach
Bez linii komend. Bez plików konfiguracyjnych. Bez problemów. Pobierz i rozpocznij czat z AI w mniej niż 5 minut.
Pobierz i zainstaluj
Pobierz instalator dla swojej platformy z GitHub Releases — Windows lub macOS (Apple Silicon). Jedno pobranie, bez konieczności zakładania konta.
Wskaż folder z modelami
Otwórz Ustawienia i wskaż Llama Control folder z modelami GGUF. Aplikacja automatycznie wykrywa LM Studio i powszechne ścieżki. Skanuje wszystkie pliki .gguf i wyświetla ich metadane.
Zainstaluj llama.cpp
Użyj wbudowanego instalatora llama.cpp w Ustawieniach, aby pobrać odpowiednią wersję dla Twojego GPU (CUDA, Vulkan lub CPU). Jeden klik, bez ręcznego rozpakowywania.
Uruchom i czatuj
Wybierz model, opcjonalnie użyj Auto-Tune do optymalizacji flag, i kliknij start. Rozmawiaj z lokalnym AI natychmiast, bez terminala, bez plików konfiguracyjnych, bez linii komend.
Zobacz to w akcji
Pełny przegląd — od uruchomienia lokalnego modelu po użycie go w agencie kodującym do zbudowania prawdziwej strony docelowej, całkowicie offline.
Niektóre fragmenty nagrania zostały przyspieszone.
Sześć potężnych narzędzi, jeden interfejs
Twoje modele GGUF, pięknie uporządkowane
Przeglądaj lokalne pliki GGUF z bogatym parsowaniem metadanych. Edytuj nazwy, opisy i tagi. Uruchamiaj lub zatrzymuj serwer dla każdego modelu z własnymi flagami i organizuj kolekcję z ulubionymi i własnymi folderami.
- Jeden klik do uruchomienia llama-server z flagami dla modelu
- Parser metadanych GGUF — architektura, kwantyzacja, parametry
- Profile serwera do szybkiego przełączania flag
- Statystyki użycia GPU VRAM, CPU i RAM w czasie rzeczywistym
- Duplikuj, eksportuj i usuwaj modele
Lokalne modele
4 modeleCzatuj z lokalnym AI
Strumieniowane odpowiedzi od uruchomionego llama-servera. Zarządzaj wieloma sesjami czatu, edytuj prompt systemowy i przejdź do trybu terminala z xterm.js dla zaawansowanych scenariuszy.
- Strumieniowane odpowiedzi w czasie rzeczywistym od lokalnego modelu
- Wiele sesji z pełną historią
- Konfigurowalne prompty systemowe
- Tryb terminala z wieloma sesjami xterm.js
- Wyświetlanie tokenów rozumowania dla modeli CoT
Przeglądaj i pobieraj z HuggingFace
Wyszukuj modele GGUF bezpośrednio z HuggingFace. Otrzymuj wskazówki dopasowania VRAM na podstawie Twojego GPU, sprawdzaj miejsce na dysku przed pobraniem i pobieraj pliki bezpośrednio do folderu modeli z możliwością wznowienia.
- Wyszukiwanie zapytaniem, kategorią lub popularnością
- Wskazówki VRAM na podstawie Twojego GPU
- Sprawdzanie miejsca na dysku przed pobraniem
- Pobieranie multi-GB z możliwością wznowienia
- Badge'y dostawców GGUF
Wyniki benchmarku
Mierz. Porównuj. Optymalizuj.
Uruchom testy szybkości llama-bench, aby zmierzyć tokeny/sekundę. Oceń jakość za pomocą 18 zadań deterministycznych obejmujących matematykę, logikę, kod i wiedzę. Oceniaj wszystko z pomocą AI.
- Benchmark szybkości llama-bench (tokeny/s)
- 18 zadań jakości: matematyka, logika, kod, format, wiedza, pułapki
- Test perplexity (wikitext-2)
- Ocena jakości AI przez Claude/OpenAI/Gemini
- Gniazda do porównywania wielu modeli
Niech AI stroi Twój serwer
Zapomnij o ręcznym strojeniu flag. Faza badania AI sugeruje optymalne flagi uruchomieniowe, a następnie automatycznie testuje każdego kandydata przez pętlę prób. KV cache quantization, rozmiary chunków, dopasowanie do VRAM, wszystko optymalizowane automatycznie.
- Faza badania AI sugeruje optymalne kandydatki flag
- Automatyczna pętla testów benchmarkowych
- Testowanie drabiny kwantyzacji KV cache
- Strojenie rozmiaru kontekstu i chunków
- Automatyczne dopasowanie do VRAM
Auto-Tune Pipeline
Analityka użycia
Poznaj swoje nawyki AI
Śledź wzorce użycia AI za pomocą kompleksowego dashboardu. Monitoruj liczbę czatów, wiadomości, czas odpowiedzi i liczbę znaków. Identyfikuj najbardziej aktywne dni i najlepsze rozmowy.
- Liczba czatów i wiadomości
- Podział wiadomości użytkownika vs asystenta
- Średni i medianowy czas odpowiedzi
- Proporcja wygenerowanych do wysłanych znaków
- Śledzenie najbardziej aktywnych dni
Co nowego w v0.1.63
- Wsparcie dla macOS (Apple Silicon) — Llama Control działa teraz natywnie na Makach z M1 i nowszych
- Czat z modelami z telefonu: włącz „Zdalny dostęp" w Ustawieniach i sparuj urządzenia w tej samej sieci Wi-Fi kodem QR lub PIN-em — na telefonie nie trzeba niczego instalować
- Nowa zakładka Wtyczki, a w niej Ekstraktor JSON — wklej tekst, zdefiniuj schemat (lub pozwól modelowi zaproponować go na podstawie tekstu) i otrzymaj ustrukturyzowany JSON gwarantowanie zgodny ze schematem
- Przycisk „Podłącz narzędzie kodujące" w Czacie generuje gotową do wklejenia konfigurację OpenCode/Crush wskazującą na Twój lokalny serwer
- Przy starcie pojawia się teraz ekran konfiguracji, jeśli llama.cpp nie jest jeszcze zainstalowane, zamiast pozostawiać aplikację w niedziałającym stanie
- Panel boczny można teraz zwinąć do wąskiego paska z ikonami, by zyskać więcej miejsca na ekranie
- Wyszukiwanie HuggingFace doładowuje teraz kolejne wyniki podczas przewijania i pokazuje datę dodania każdego modelu
- Dodano przycisk odświeżania na liście zapisanych czatów
- Dodano wyjaśnienie, dlaczego scroll myszą może nie działać w panelu terminala OpenCode, wraz z poprawką konfiguracji
Najczęściej zadawane pytania
Wszystko, co musisz wiedzieć o Llama Control.
Gotowy, aby przejąć kontrolę?
Pobierz Llama Control za darmo i zacznij zarządzać swoim lokalnym AI już dziś. Windows 10+ lub macOS (Apple Silicon), bez konieczności zakładania konta.
v0.1.63 — Windows 10/11 (~110 MB) lub macOS Apple Silicon (~130 MB)