Xây dựng AI server riêng với LocalAI trên Linux. Hướng dẫn chi tiết cách chạy LLM, tạo ảnh và TTS tương thích 100% với OpenAI API, hoạt động hoàn toàn offline.
Sau 6 tháng dùng OpenAI, Claude và Gemini trên production, mình tổng hợp lại bảng so sánh chi phí thực tế, điểm mạnh yếu của từng platform và framework chọn AI API phù hợp cho từng loại task. Chuyển sang model routing giúp mình cắt chi phí từ $340 xuống $90/tháng với cùng throughput.
Hướng dẫn chạy LLM local với Ollama: so sánh Ollama, llama.cpp và LM Studio để chọn đúng approach, cài đặt trên Linux/macOS, chạy model Mistral và Llama, tích hợp REST API tương thích OpenAI, và tips setup shared server cho cả team.