MarkTechPost

Google Cloud luôn bật Memory Agent thay thế RAG và Embeddings bằng việc hợp nhất LLM liên tục trên Gemini 3.1 Flash-Lite

🕐 20/07/2026 09:32 📰 MarkTechPost ✅ Đã dịch sang tiếng Việt

Hầu hết các AI agent đều có tính "hay quên". Chúng xử lý một yêu cầu, trả lời xong rồi bỏ qua bối cảnh. Kho lưu trữ generative-ai của Google Cloud hiện đã phát hành một mẫu giải quyết trực tiếp vấn đề này. Đó là Always-On Memory Agent, một triển khai tham chiếu coi bộ nhớ như một tiến trình đang chạy liên tục.

Về cơ bản, dự án này là một agent nền nhẹ không bao giờ dừng. Nó chạy 24/7 như một tiến trình liên tục, không phải lệnh gọi một lần. Nó được xây dựng bằng Google ADK (Agent Development Kit) và Gemini 3.1 Flash-Lite. Đáng chú ý, nó không sử dụng cơ sở dữ liệu vector hay embedding. Thay vào đó, một LLM đọc, suy nghĩ và ghi bộ nhớ có cấu trúc vào SQLite. Việc chọn mô hình này nhắm đến độ trễ thấp và chi phí thấp cho công việc nền liên tục.

Về mặt kiến trúc, một bộ điều phối (orchestrator) định tuyến mọi yêu cầu đến một trong ba sub-agent chuyên biệt. Mỗi sub-agent sở hữu các công cụ riêng để đọc hoặc ghi vào kho lưu trữ bộ nhớ.

Đầu tiên, IngestAgent xử lý nội dung đến. Nó sử dụng khả năng đa phương thức của Gemini để trích xuất tóm tắt, thực thể, chủ đề và điểm quan trọng. Bản ghi có cấu trúc đó sau đó được lưu vào bảng memories.

Tiếp theo, ConsolidateAgent chạy theo bộ hẹn giờ, mặc định là mỗi 30 phút. Giống như chu kỳ ngủ, nó xem xét các bộ nhớ chưa được hợp nhất và tìm ra các kết nối giữa chúng. Sau đó, nó ghi một bản tóm tắt tổng hợp, một hiểu biết chính và các kết nối đó vào cơ sở dữ liệu. Kết quả là, agent xây dựng hiểu biết mới trong khi không hoạt động, không cần prompt.

Cuối cùng, QueryAgent trả lời các câu hỏi. Nó đọc tất cả bộ nhớ và các hiểu biết đã hợp nhất, sau đó tổng hợp một phản hồi. Quan trọng là, nó trích dẫn các ID bộ nhớ đã sử dụng làm nguồn.

Ngoài văn bản, IngestAgent chấp nhận 27 loại tệp thuộc năm danh mục. Chỉ cần thả bất kỳ tệp được hỗ trợ nào vào thư mục ./inbox để được tự động lấy.

Để làm rõ sự khác biệt, nó phác thảo ba cách tiếp cận bộ nhớ phổ biến. Mỗi cách giải quyết một phần vấn đề, nhưng vẫn để lại khoảng trống.

Không giống như RAG, agent này xử lý bộ nhớ một cách chủ động, không chỉ khi truy xuất.

Thực tế, mẫu này phù hợp với bất kỳ khối lượng công việc nào cần bối cảnh bền vững và phát triển. Hãy xem xét ba ví dụ.

Với thiết kế rõ ràng, việc thiết lập là tối thiểu cho các kỹ sư cấp thấp. Cài đặt các phụ thuộc, đặt key của bạn, sau đó khởi động tiến trình.

Khi đã chạy, agent theo dõi ./inbox, hợp nhất mỗi 30 phút và phục vụ API HTTP trên cổng 8888. Do đó, bạn cũng có thể cung cấp dữ liệu qua HTTP.

Ngoài ra, API còn hiển thị /status, /memories, /consolidate, /delete và /clear. Một bảng điều khiển Streamlit tùy chọn thêm các điều khiển nhập, truy vấn, duyệt và xóa. Các cờ CLI thay đổi thư mục theo dõi, cổng và khoảng thời gian hợp nhất.

Xem FULL CODES tại đây. Ngoài ra, hãy theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi và Đăng ký Nhận bản tin của chúng tôi. Chờ đã! Bạn đang dùng telegram? Giờ bạn cũng có thể tham gia cùng chúng tôi trên telegram.

Cần hợp tác với chúng tôi để quảng bá GitHub Repo hoặc Hugging Face Page hoặc Phát hành Sản phẩm hoặc Hội thảo trực tuyến, v.v.? Kết nối với chúng tôi

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova.

Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc biến các tập dữ liệu phức tạp thành những thông tin chi tiết có thể ứng dụng.

📎 Nguồn gốc: MarkTechPost Xem bài gốc →