Tại sao mình bỏ Perplexity để chuyển sang dùng Perplexica?
2 giờ sáng tuần trước, khi đang debug dở con bot cào dữ liệu, mình nhận ngay thông báo “Daily limit reached” từ Perplexity. Cảm giác lúc đó cực kỳ hụt hẫng. Việc phụ thuộc vào một nền tảng trả phí 20 USD/tháng nhưng vẫn bị giới hạn quota khiến mình quyết định tìm phương án tự host (self-hosted).
Sau khi thử qua vài công cụ, mình chọn Perplexica. Đây là một dự án mã nguồn mở mô phỏng lại cách hoạt động của Perplexity AI. Nó dùng SearxNG để quét Internet, sau đó đẩy dữ liệu vào các mô hình ngôn ngữ (LLM) như Claude, GPT-4 hoặc Llama 3 chạy cục bộ qua Ollama để tổng hợp câu trả lời. Bạn có toàn quyền kiểm soát dữ liệu, không lo bị dùng để train model và quan trọng nhất là hoàn toàn miễn phí.
Cài đặt Perplexica: Nhanh, gọn và sạch sẽ
Bạn có thể cài thủ công bằng Node.js và Python, nhưng đừng dại gì mà đâm đầu vào mớ hỗn độn dependency đó. Docker Compose là lựa chọn thông minh nhất để giữ môi trường sạch sẽ.
1. Chuẩn bị môi trường
Máy chủ (VPS) hoặc PC của bạn cần cài sẵn Docker. Mình đang chạy hệ thống này trên một VPS Ubuntu 22.04 với 8GB RAM. Nếu bạn chạy LLM local qua Ollama, hãy ưu tiên máy có GPU để tốc độ phản hồi không bị chậm như rùa bò.
2. Lấy mã nguồn và thiết lập cấu hình
Bắt đầu bằng việc clone repository từ GitHub:
git clone https://github.com/ItSOSS/perplexica.git
cd perplexica
Tiếp theo, hãy tạo file cấu hình từ file mẫu có sẵn:
cp sample.config.toml config.toml
3. Khởi chạy với Docker Compose
File docker-compose.yaml đi kèm đã bao gồm đầy đủ frontend, backend và SearxNG. Bạn chỉ cần thực thi lệnh:
docker compose up -d
Hệ thống sẽ tải các image cần thiết về. Lưu ý rằng image SearxNG khá nặng (khoảng 1GB). Nếu mạng chậm, bạn hãy kiên nhẫn một chút hoặc đổi sang DNS của Google hay Cloudflare để tăng tốc độ tải.
Cấu hình “bộ não” cho hệ thống
Container chạy xong không có nghĩa là dùng được ngay. Bạn cần chỉ định cho Perplexica biết nó sẽ dùng model nào để tư duy.
Kết nối LLM qua API hoặc Local
Mở file config.toml và tập trung vào phần provider. Mình đã thử nghiệm hai hướng:
- Dùng Groq (Ưu tiên tốc độ): Groq hỗ trợ Llama 3 với tốc độ phản hồi lên tới 250-300 tokens/giây. Gần như bạn nhấn Enter là có kết quả ngay.
- Dùng Ollama (Ưu tiên riêng tư): Phù hợp khi bạn không muốn bất kỳ dữ liệu nào rời khỏi máy mình.
Một lỗi phổ biến khiến nhiều người loay hoay cả tiếng là lỗi kết nối Docker. Nếu chạy Ollama trên cùng một máy, đừng dùng localhost. Hãy sửa thành:
[EVNIRONMENTS]
# Địa chỉ để container backend nhìn thấy host
OLLAMA_URL = "http://host.docker.internal:11434"
Tối ưu hóa SearxNG (Đôi mắt tìm kiếm)
SearxNG là công cụ tìm kiếm ẩn danh cực tốt nhưng hay bị Google chặn IP. Kinh nghiệm của mình là hãy vào searxng/settings.yml, bật thêm các engine như DuckDuckGo hoặc Brave Search. Việc đa dạng nguồn tìm kiếm giúp hệ thống hoạt động ổn định hơn khi một engine nào đó gặp sự cố.
Vận hành và xử lý sự cố
Mỗi khi thay đổi file config.toml, bạn cần khởi động lại backend để áp dụng:
docker compose restart backend
Bây giờ, hãy mở trình duyệt và truy cập http://localhost:3000. Giao diện hiện ra rất tối giản và hiện đại. Nếu nhấn tìm kiếm mà gặp lỗi “Internal Server Error”, đừng cuống. Hãy kiểm tra log ngay:
docker compose logs -f backend
Thông thường, lỗi này do API key bị sai hoặc SearxNG bị rate limit. Nếu dùng VPS, hãy cân nhắc cấu hình thêm một proxy đơn giản để tránh bị các engine tìm kiếm đưa vào danh sách đen.
Các chế độ tìm kiếm chuyên sâu
Perplexica không chỉ tìm kiếm chung chung. Nó có các chế độ rất đáng giá:
- Academic Search: Chỉ lục tìm trong các bài báo khoa học, cực kỳ hữu ích cho anh em làm nghiên cứu.
- YouTube Search: Nó sẽ quét transcript video để trả lời, giúp bạn tiết kiệm hàng giờ xem clip dài lê thê.
Khi dùng Academic Search, kết quả trả về luôn kèm nguồn trích dẫn (citation) chuẩn xác. Chất lượng không hề thua kém các công cụ trả phí đắt đỏ.
Đánh giá hiệu năng thực tế
Nếu chạy trên CPU thuần, các model như Llama-3-8B sẽ mất khoảng 10-15 giây để trả lời. Ngược lại, nếu có GPU (như RTX 3060 trở lên), tốc độ sẽ gần như tức thì. Việc tự dựng AI Search Engine không chỉ giúp tiết kiệm 20 USD mỗi tháng. Nó còn là cơ hội để bạn hiểu sâu về RAG (Retrieval-Augmented Generation) – công nghệ cốt lõi đứng sau những gã khổng lồ AI hiện nay.

