Không cần RTX 5090, mình vẫn chạy được một “AI bạn gái” local trên GTX 3050.

Sau khi xem một mô hình Agent bạn gái AI được cộng đồng Trung Quốc chia sẻ, mình thử dựng lại phiên bản nhẹ hơn để kiểm tra xem máy phổ thông có chạy nổi hay không.

Khác với mô hình gốc cần khoảng 15GB VRAM và thường được chạy trên RTX 5080 hoặc 5090, phiên bản mình test đã giảm kích thước model và tạm thời bỏ phần voice input để phù hợp hơn với GTX 3050.

Điểm mình thấy thú vị nhất là toàn bộ hệ thống đều chạy local trên máy:

✅ Không cần kết nối API

✅ Nội dung trò chuyện không phải gửi lên dịch vụ bên ngoài

✅ Có thể tùy chỉnh tính cách và cách phản hồi

✅ Không phụ thuộc vào Internet sau khi đã chuẩn bị đủ model

Hiện phiên bản test chủ yếu tập trung vào khả năng hội thoại và phản hồi bằng giọng nói. Do sử dụng model nhỏ, tốc độ và độ thông minh chắc chắn chưa thể so với các hệ thống chạy trên GPU cao cấp, nhưng kết quả vẫn khá ổn đối với một chiếc GTX 3050.

Nếu được cấp thêm quyền và kết nối với các công cụ khác, Agent dạng này có thể phát triển xa hơn việc trò chuyện, chẳng hạn như điều khiển thiết bị thông minh, mở ứng dụng hoặc hỗ trợ một số công việc hằng ngày.

Tất nhiên, đây mới chỉ là bản thử nghiệm kỹ thuật chứ chưa phải “người yêu AI” hoàn chỉnh.😆 Nhưng việc một máy tính cá nhân có thể tự chạy LLM, nhận diện giọng nói và tạo giọng nói mà không cần API cho thấy AI local đang ngày càng dễ tiếp cận hơn.

Biết đâu vài năm nữa, người đầu tiên hỏi bạn:

“Hôm nay của anh thế nào?”

lại không phải người yêu, mà là chiếc máy tính đang đặt trên bàn. 😂

Cấu hình mình sử dụng:

  • GPU: GTX 3050
  • LLM: Llama 3.2 3B
  • Nhận diện giọng nói: Whisper Small
  • Giọng nói AI: Qwen3-TTS 0.6B
  • Cách giao tiếp: nhập văn bản thay vì trò chuyện bằng giọng nói trực tiếp

#LocalAI #AIAgent #Llama32 #Whisper #Qwen3TTS #GTX3050 #ArtificialIntelligence