20/06/2026 – (AIHanhChinhCong.vn) – Nhiều cơ quan hành chính hiện nay đã quan tâm đến trí tuệ nhân tạo, trợ lý số, hệ thống hỏi đáp thủ tục, tự động tóm tắt văn bản hoặc hỗ trợ tổng hợp báo cáo. Tuy nhiên, từ quan tâm đến triển khai hiệu quả là một khoảng cách lớn. Nếu đưa AI vào quy trình hành chính quá nhanh, thiếu giới hạn, thiếu người kiểm duyệt và thiếu chỉ số đo, cơ quan rất dễ rơi vào tình trạng “thử cho có”, không biết hiệu quả thật ở đâu, rủi ro nằm chỗ nào và có nên mở rộng hay không.
Vì vậy, thay vì triển khai đại trà, một hướng đi phù hợp hơn là thiết kế thí điểm Agent OS trong 90 ngày. Đây không phải là dự án công nghệ quy mô lớn. Đây là một bài kiểm tra năng lực vận hành: cơ quan có chọn đúng việc không, có chuẩn hóa được tài liệu không, có giao việc rõ cho AI không, có kiểm soát đầu ra không, có đo được thời gian, lỗi và phản hồi của cán bộ không.
Cách tiếp cận này phù hợp với xu hướng quốc tế. Báo cáo của World Economic Forum năm 2026 về năng lực sẵn sàng của chính phủ với AI có khả năng hành động nhấn mạnh rằng các cơ quan công không nên chỉ nhìn vào tiềm năng công nghệ, mà phải chọn điểm bắt đầu dựa trên giá trị công, mức độ phức tạp và rủi ro có thể quản lý. OECD cũng chỉ ra rằng nhiều ứng dụng AI trong khu vực công vẫn dừng ở giai đoạn thử nghiệm vì thiếu dữ liệu tốt, thiếu kỹ năng, thiếu hạ tầng cũ được nâng cấp và thiếu cơ chế quản trị đáng tin cậy.
Bài viết này đề xuất một kế hoạch thực thi 90 ngày dành cho cơ quan hành chính muốn thí điểm Agent OS theo hướng nhỏ, rõ, đo được, có kiểm soát và không ảnh hưởng dữ liệu nhạy cảm. Bài viết hạn chế tối đa thuật ngữ tiếng Anh; những khái niệm chuyên môn sẽ được Việt hóa để cán bộ lãnh đạo, chuyên viên nghiệp vụ, văn phòng, pháp chế và công nghệ thông tin đều có thể cùng hiểu, cùng làm và cùng đánh giá.
Thí điểm Agent OS là gì và vì sao không nên làm đại trà ngay?
Trong phạm vi bài viết này, Agent OS có thể hiểu là lớp vận hành giúp các trợ lý AI làm việc theo quy trình, có kho tri thức, có tiêu chuẩn, có vai trò, có nhật ký và có người kiểm duyệt. Nói đơn giản hơn, nếu một trợ lý AI giống như một “cán bộ số hỗ trợ việc lặp lại”, thì Agent OS là cách cơ quan tổ chức, giao việc, giám sát và đánh giá cán bộ số đó.
Điểm khác biệt quan trọng là Agent OS không chỉ là phần mềm hỏi đáp. Nó liên quan đến cách cơ quan chuẩn hóa văn bản, mô tả quy trình, phân quyền dữ liệu, thiết kế mẫu đầu ra, xác định người duyệt và lưu lại bằng chứng vận hành. Vì vậy, nếu triển khai đại trà khi những nền tảng này chưa sẵn sàng, cơ quan có thể có nhiều công cụ mới nhưng không kiểm soát được chất lượng, không đo được hiệu quả và khó giải trình khi xảy ra sai sót.
Thí điểm 90 ngày giúp giảm rủi ro này. Trong 90 ngày, cơ quan chỉ chọn một trường hợp cụ thể, chạy trong phạm vi hẹp, dùng dữ liệu đã được kiểm tra, yêu cầu con người duyệt mọi đầu ra và đo các chỉ số rõ ràng. Nếu kết quả tốt, cơ quan có căn cứ để mở rộng. Nếu kết quả chưa tốt, cơ quan vẫn học được bài học về dữ liệu, quy trình, con người và kiểm soát mà chưa gây tác động lớn đến hoạt động chính thức.
🔴 Chuỗi bài về Hệ điều hành Agent – Agent OS trong hành chính công:
1) Agent OS là gì? Vì sao hành chính công cần một “hệ điều hành agent” thay vì chỉ dùng chatbot?
2) Lãnh đạo hành chính trong kỷ nguyên AI agent: từ giao việc cho con người sang thiết kế hệ vận hành thông minh
3) 12 trường hợp sử dụng Agent OS + Claude + Hermes cho cơ quan hành chính từ cấp xã đến cấp Bộ
4) Quản trị cho AI Agent trong hoạt động hành chính công: kiểm soát rủi ro, dữ liệu, trách nhiệm và niềm tin
5) Cơ quan hành chính đã sẵn sàng với Agent OS chưa? Bộ tiêu chí tự đánh giá trước khi triển khai👉 Tham gia Cộng đồng AI Hành Chính Công TẠI ĐÂY
Nguyên tắc thí điểm: nhỏ, rõ, đo được, có kiểm soát
Một thí điểm Agent OS trong cơ quan hành chính không nên bắt đầu bằng câu hỏi “công cụ nào mạnh nhất?”. Câu hỏi đúng hơn là: việc nào đủ nhỏ để kiểm soát, đủ rõ để giao cho AI hỗ trợ, đủ lặp lại để tạo giá trị và đủ dễ đo để biết hiệu quả?
Nguyên tắc thứ nhất là nhỏ. Cơ quan chỉ nên chọn một trường hợp thí điểm, một nhóm người dùng, một loại tài liệu hoặc một quy trình hẹp. Ví dụ, không nên bắt đầu bằng “ứng dụng AI cho toàn bộ văn phòng”. Nên bắt đầu bằng “hỗ trợ tóm tắt văn bản đến và trích xuất nhiệm vụ, thời hạn, đơn vị liên quan”.
Nguyên tắc thứ hai là rõ. Trợ lý AI phải biết mình được làm gì, không được làm gì, dùng nguồn tài liệu nào, tạo đầu ra theo mẫu nào và khi nào phải báo “không đủ căn cứ”. Nếu nhiệm vụ mơ hồ, AI rất dễ tạo ra câu trả lời trôi chảy nhưng không chắc đúng.
Nguyên tắc thứ ba là đo được. Mỗi thí điểm phải có chỉ số trước và sau. Nếu trước đây cán bộ mất trung bình 15 phút để tóm tắt một văn bản, sau thí điểm cần đo xem thời gian còn bao nhiêu khi đã tính cả bước kiểm duyệt. Nếu thí điểm hỗ trợ tổng hợp báo cáo, cần đo tỷ lệ nội dung phải sửa, số lỗi phát hiện và mức độ hài lòng của người dùng.
Nguyên tắc thứ tư là có kiểm soát. Mọi đầu ra của AI trong giai đoạn thí điểm phải có người xem lại trước khi dùng chính thức. Cơ quan cần lưu nhật ký đầu vào, đầu ra, người duyệt, thời điểm xử lý và lỗi phát hiện. Các khuyến nghị quốc tế về quản trị AI đều nhấn mạnh rằng khi AI có khả năng tham gia nhiều bước công việc, khả năng theo dõi, kiểm tra và truy vết trở thành điều kiện bắt buộc chứ không phải phần phụ.
Nguyên tắc thứ năm là không ảnh hưởng dữ liệu nhạy cảm. Trong giai đoạn đầu, cơ quan nên tránh dùng dữ liệu cá nhân nhạy cảm, hồ sơ khiếu nại phức tạp, tài liệu mật, hồ sơ kỷ luật hoặc dữ liệu có thể ảnh hưởng trực tiếp đến quyền lợi công dân. Thí điểm tốt là thí điểm giúp cơ quan học được cách vận hành AI an toàn, không phải thí điểm đẩy hệ thống vào vùng rủi ro cao ngay từ đầu.
Chọn trường hợp thí điểm: bắt đầu từ việc lặp lại, ít rủi ro và dễ kiểm tra
Không phải trường hợp nào cũng phù hợp để thí điểm Agent OS. Cơ quan nên ưu tiên các việc có tần suất cao, đầu vào rõ, đầu ra dễ kiểm tra và không yêu cầu AI tự quyết định thay con người. Trong giai đoạn đầu, bốn nhóm phù hợp nhất là văn bản điều hành, tổng hợp báo cáo, hỗ trợ tra cứu thủ tục và chuẩn hóa biểu mẫu.
Văn bản điều hành là lựa chọn rất phù hợp vì cơ quan nào cũng có văn bản đến, văn bản đi, nhiệm vụ lãnh đạo giao, thời hạn xử lý và yêu cầu theo dõi tiến độ. AI có thể hỗ trợ tóm tắt nội dung, nhận diện thời hạn, trích xuất nhiệm vụ, gợi ý đơn vị liên quan và tạo bảng theo dõi. Tuy nhiên, AI không được tự giao việc chính thức hoặc tự thay đổi trạng thái nhiệm vụ nếu chưa có người duyệt.
Tổng hợp báo cáo cũng là trường hợp có giá trị cao. Nhiều cơ quan mất nhiều thời gian để thu thập báo cáo tuần, tháng, quý; chuẩn hóa cấu trúc; phát hiện thiếu số liệu; và viết phần nhận định. AI có thể hỗ trợ chuẩn hóa đầu vào, tổng hợp ý chính, chỉ ra phần thiếu và tạo bản nháp báo cáo. Cán bộ tổng hợp vẫn là người quyết định nội dung cuối cùng.
Hỗ trợ tra cứu thủ tục phù hợp với bộ phận một cửa, cấp xã, phường, trung tâm phục vụ hành chính công hoặc các đơn vị thường xuyên hướng dẫn người dân. AI có thể trả lời theo kho thủ tục đã được duyệt, nêu thành phần hồ sơ, thời hạn, biểu mẫu và kênh nộp. Tuy nhiên, AI chỉ nên hướng dẫn thông tin chung, không kết luận trường hợp pháp lý cụ thể thay cán bộ.
Chuẩn hóa biểu mẫu là lựa chọn rủi ro thấp nếu dữ liệu đầu vào không nhạy cảm. AI có thể phát hiện biểu mẫu thiếu trường thông tin, gợi ý thống nhất cách đặt tên, chuẩn hóa văn phong và tạo bản nháp theo mẫu. Đây là nhóm thí điểm phù hợp để tạo nền cho các bước nâng cao hơn sau này.
| Nhóm thí điểm | Việc AI có thể hỗ trợ | Điều cần kiểm soát | Chỉ số đo phù hợp |
|---|---|---|---|
| Văn bản điều hành | Tóm tắt văn bản, trích xuất nhiệm vụ, nhận diện thời hạn | Không tự giao việc chính thức; phải có người duyệt | Thời gian tóm tắt, tỷ lệ bỏ sót nhiệm vụ, tỷ lệ phải sửa |
| Tổng hợp báo cáo | Chuẩn hóa báo cáo, tổng hợp ý chính, phát hiện thiếu thông tin | Không tự kết luận thay lãnh đạo; kiểm tra số liệu | Thời gian tổng hợp, tỷ lệ thiếu trường dữ liệu, mức hài lòng |
| Tra cứu thủ tục | Hướng dẫn hồ sơ, thời hạn, biểu mẫu, kênh nộp | Chỉ dùng kho thủ tục đã duyệt; không kết luận vụ việc cụ thể | Số câu trả lời đúng, số lỗi hướng dẫn, phản hồi cán bộ |
| Chuẩn hóa biểu mẫu | Rà soát mẫu, gợi ý cấu trúc, thống nhất văn phong | Không dùng dữ liệu cá nhân nhạy cảm | Số biểu mẫu chuẩn hóa, số lỗi định dạng giảm |
Bảng trên cho thấy điểm chung của các trường hợp phù hợp là AI chỉ hỗ trợ phần chuẩn bị, kiểm tra, gợi ý hoặc tổng hợp. Quyết định cuối cùng vẫn thuộc về cán bộ, lãnh đạo hoặc người có thẩm quyền. Đây là nguyên tắc rất quan trọng để thí điểm không làm mờ trách nhiệm công vụ.
Thí điểm Agent OS nên bắt đầu từ một việc nhỏ, có dữ liệu rõ, có người kiểm duyệt và có chỉ số đo hiệu quả
Thiết kế Agent OS tối thiểu: không cần lớn, nhưng phải đủ nền
Một thí điểm 90 ngày không cần xây dựng nền tảng quá lớn. Tuy nhiên, nếu chỉ thử vài câu lệnh AI rời rạc thì không thể gọi là thí điểm Agent OS. Cơ quan cần thiết kế một Agent OS tối thiểu gồm sáu thành phần: kho tri thức, tiêu chuẩn, quy trình, vai trò, nhật ký và kiểm duyệt.
Kho tri thức là tập hợp tài liệu được phép dùng cho thí điểm. Đó có thể là quy chế làm việc, mẫu văn bản, văn bản hướng dẫn, danh mục thủ tục, câu hỏi thường gặp, báo cáo cũ hoặc biểu mẫu. Mỗi tài liệu cần có nguồn, ngày cập nhật, người xác nhận và trạng thái sử dụng. Tài liệu không rõ hiệu lực hoặc chứa dữ liệu nhạy cảm nên loại khỏi kho thí điểm.
Tiêu chuẩn là cách cơ quan quy định đầu vào và đầu ra. Ví dụ, văn bản tóm tắt phải có nội dung chính, nhiệm vụ, thời hạn, đơn vị liên quan và điểm cần lưu ý. Báo cáo tổng hợp phải có số liệu, nhận định, vấn đề tồn tại và kiến nghị. Nếu không có tiêu chuẩn, AI có thể tạo nhiều kiểu đầu ra khác nhau, gây khó kiểm tra.
Quy trình xác định AI tham gia bước nào, ai kiểm duyệt, khi nào được dùng đầu ra và khi nào phải dừng. Đây là điểm biến thí điểm từ “thử công cụ” thành “thử cách vận hành”. Một quy trình tốt phải nêu rõ điểm dừng bắt buộc trước khi thông tin đi vào văn bản chính thức hoặc trình lãnh đạo.
Vai trò giúp tránh tình trạng mọi việc đều dồn cho bộ phận công nghệ thông tin. Lãnh đạo bảo trợ, chủ quy trình nghiệp vụ, người kiểm duyệt, pháp chế, văn phòng, công nghệ thông tin và an toàn thông tin đều có phần việc riêng. AI trong hành chính công là vấn đề nghiệp vụ, pháp lý, dữ liệu và kiểm soát, không chỉ là vấn đề kỹ thuật.
Nhật ký là nơi lưu lại đầu vào, đầu ra, câu lệnh chuẩn, người duyệt, lỗi phát hiện và phiên bản điều chỉnh. Nếu không có nhật ký, cơ quan không thể truy vết khi có sai sót và không học được từ quá trình thí điểm.
Kiểm duyệt là nguyên tắc bắt buộc trong 90 ngày đầu. AI chỉ tạo bản nháp, bản gợi ý hoặc bản tổng hợp sơ bộ. Cán bộ được phân công phải xem lại trước khi sử dụng. Khi thí điểm kết thúc, cơ quan mới có căn cứ để quyết định mức độ tự động hóa nào có thể tăng lên và mức nào vẫn phải giữ con người kiểm soát.
Kế hoạch 90 ngày: bốn giai đoạn, mỗi giai đoạn có sản phẩm đầu ra
Kế hoạch 90 ngày nên được chia thành bốn giai đoạn. Mỗi giai đoạn cần có việc phải làm, sản phẩm đầu ra, vai trò phụ trách và chỉ số đo. Cách chia này giúp cơ quan không bị cuốn vào thử nghiệm kỹ thuật mà quên mục tiêu quản trị.
| Giai đoạn | Trọng tâm | Việc cần làm | Sản phẩm đầu ra | Vai trò chính | Chỉ số đo gợi ý |
|---|---|---|---|---|---|
| Tuần 1–2 | Khảo sát và chuẩn hóa tài liệu đầu vào | Chọn trường hợp thí điểm, mô tả quy trình hiện tại, tập hợp tài liệu, loại dữ liệu nhạy cảm | Phiếu thí điểm, danh mục tài liệu, số liệu nền ban đầu | Lãnh đạo, nghiệp vụ, văn phòng, pháp chế | Có 1 trường hợp hẹp; có bộ tài liệu đầu vào đã phân loại |
| Tuần 3–6 | Xây trợ lý AI và kịch bản kiểm soát | Xây kho tri thức, câu lệnh chuẩn, mẫu đầu ra, tình huống kiểm thử, tiêu chí lỗi | Trợ lý thử nghiệm, bộ câu lệnh chuẩn, bảng kiểm duyệt | Nghiệp vụ, công nghệ thông tin, người kiểm duyệt | Tỷ lệ đầu ra đạt yêu cầu sau kiểm thử tăng dần |
| Tuần 7–10 | Chạy thử có kiểm soát | Chạy với dữ liệu thật nhưng không nhạy cảm, đo thời gian, đo lỗi, thu phản hồi | Báo cáo tuần, danh sách lỗi, phiên bản cải tiến | Người dùng thử, chủ quy trình, kiểm duyệt | Giảm thời gian thao tác; lỗi nghiêm trọng bằng 0 |
| Tuần 11–12 | Tổng kết và quyết định | Đánh giá chỉ số, rủi ro, phản hồi, chi phí vận hành; kiến nghị mở rộng hoặc điều chỉnh | Báo cáo kết thúc thí điểm, quyết định tiếp theo | Lãnh đạo, pháp chế, công nghệ thông tin, nghiệp vụ | Có kết luận rõ: mở rộng, điều chỉnh hoặc dừng |
Bảng này có thể dùng như khung quản lý chung cho nhiều loại thí điểm. Tùy quy mô cơ quan, số lượng tài liệu và độ phức tạp của trường hợp thí điểm, từng cơ quan có thể điều chỉnh chi tiết. Tuy nhiên, tinh thần không đổi là: không chuyển sang giai đoạn sau nếu giai đoạn trước chưa có sản phẩm đầu ra đủ rõ.
Tuần 1–2: khảo sát và chuẩn hóa tài liệu đầu vào
Hai tuần đầu tiên là giai đoạn đặt nền. Cơ quan cần chọn đúng trường hợp thí điểm và mô tả quy trình hiện tại bằng ngôn ngữ dễ hiểu. Ví dụ, nếu chọn văn bản điều hành, nhóm thí điểm cần mô tả văn bản đến được tiếp nhận ở đâu, ai đọc, ai tóm tắt, ai đề xuất xử lý, ai trình lãnh đạo và thông tin nào thường bị bỏ sót.
Ở giai đoạn này, nhóm thí điểm phải tập hợp tài liệu đầu vào. Tài liệu cần được phân loại theo nhóm: tài liệu được phép dùng, tài liệu cần ẩn thông tin, tài liệu chưa rõ hiệu lực và tài liệu không được dùng. Việc phân loại này giúp tránh đưa dữ liệu nhạy cảm vào hệ thống khi chưa có đủ cơ chế bảo vệ.
Sản phẩm quan trọng nhất của tuần 1–2 là phiếu thí điểm. Phiếu này phải trả lời các câu hỏi: thí điểm nhằm cải thiện việc gì, dùng dữ liệu nào, không dùng dữ liệu nào, AI được hỗ trợ đến đâu, ai duyệt đầu ra, đo bằng chỉ số nào và khi nào phải dừng. Nếu chưa hoàn thành phiếu thí điểm, cơ quan chưa nên bước sang xây trợ lý AI.
Tuần 3–6: xây trợ lý AI, kịch bản, câu lệnh chuẩn và tiêu chí kiểm soát
Từ tuần 3 đến tuần 6, nhóm thí điểm bắt đầu xây trợ lý AI trong phạm vi đã xác định. Ở đây, nên dùng cách gọi dễ hiểu là trợ lý AI chuyên việc thay vì dùng nhiều thuật ngữ kỹ thuật. Trợ lý này chỉ phục vụ một nhiệm vụ hẹp, ví dụ tóm tắt văn bản đến, tổng hợp báo cáo tuần hoặc hướng dẫn thủ tục từ kho tri thức đã duyệt.
Câu lệnh chuẩn là phần rất quan trọng. Đây là bộ hướng dẫn cho AI biết vai trò, nguồn tài liệu được phép dùng, định dạng đầu ra, cách xử lý khi thiếu thông tin và những điều không được làm. Ví dụ, câu lệnh chuẩn phải yêu cầu AI không tự suy đoán thời hạn nếu văn bản không nêu rõ; phải ghi “chưa đủ căn cứ” nếu thiếu dữ liệu; và phải trình bày đầu ra theo mẫu thống nhất.
Song song với câu lệnh chuẩn, cơ quan cần xây bảng kiểm duyệt. Bảng này giúp người kiểm duyệt đánh giá đầu ra theo tiêu chí rõ ràng: có đúng nội dung chính không, có bỏ sót nhiệm vụ không, có nhầm thời hạn không, có thêm thông tin không có trong tài liệu không, có đúng văn phong hành chính không. Mỗi lỗi cần được ghi lại để điều chỉnh kho tri thức hoặc câu lệnh chuẩn.
Tuần 7–10: chạy thử, đo thời gian, đo lỗi và thu phản hồi
Giai đoạn chạy thử là lúc cơ quan kiểm chứng giá trị thật. Dữ liệu dùng trong giai đoạn này có thể là dữ liệu thật nhưng cần loại bỏ hoặc che thông tin nhạy cảm nếu cần. Mọi đầu ra vẫn phải có con người kiểm duyệt trước khi dùng trong công việc chính thức.
Cơ quan cần đo cả hiệu suất và chất lượng. Hiệu suất là thời gian giảm được ở thao tác mục tiêu. Chất lượng là tỷ lệ đầu ra đúng, tỷ lệ phải sửa, loại lỗi thường gặp và số lần AI không đủ căn cứ. Nếu chỉ đo thời gian mà không đo lỗi, cơ quan có thể nhầm lẫn giữa “nhanh hơn” và “tốt hơn”. Trong hành chính công, nhanh hơn chỉ có ý nghĩa khi vẫn đúng, đủ căn cứ và có thể giải trình.
Phản hồi của cán bộ dùng thử cũng rất quan trọng. Có thể AI tạo bản tóm tắt đúng nhưng văn phong chưa phù hợp; có thể bản báo cáo đủ ý nhưng chưa đúng thói quen trình bày của cơ quan; có thể AI xử lý tốt văn bản ngắn nhưng yếu với văn bản nhiều phụ lục. Những phản hồi này là dữ liệu quý để cải tiến. Thí điểm không phải để chứng minh AI hoàn hảo, mà để phát hiện điều kiện giúp AI hữu ích và an toàn hơn.
Tuần 11–12: tổng kết, quyết định mở rộng hoặc điều chỉnh
Hai tuần cuối là giai đoạn ra quyết định. Cơ quan cần tổng hợp số liệu, đánh giá lỗi, xem phản hồi người dùng, rà soát rủi ro và xác định chi phí vận hành nếu mở rộng. Không nên kết thúc thí điểm bằng nhận xét chung chung như “AI có tiềm năng” hoặc “AI chưa ổn”. Kết luận phải dựa trên bằng chứng.
Có ba khả năng sau thí điểm. Khả năng thứ nhất là mở rộng có điều kiện. Điều này phù hợp khi trường hợp thí điểm đạt chỉ số, không có lỗi nghiêm trọng, người dùng chấp nhận và cơ chế kiểm soát đủ rõ. Khả năng thứ hai là điều chỉnh và thí điểm lại. Điều này xảy ra khi có giá trị nhưng kho tri thức chưa tốt, câu lệnh chuẩn chưa ổn hoặc quy trình duyệt còn chậm. Khả năng thứ ba là dừng trường hợp thí điểm nếu rủi ro lớn hơn lợi ích hoặc không đo được hiệu quả.
Báo cáo kết thúc thí điểm nên trình lãnh đạo theo hướng phục vụ quyết định. Báo cáo cần nêu rõ thí điểm có đạt mục tiêu không, tiết kiệm được gì, phát sinh lỗi gì, người dùng phản hồi ra sao, điều kiện nào cần hoàn thiện và kiến nghị bước tiếp theo là gì.
Bộ chỉ số đo hiệu quả đề xuất
Chỉ số đo hiệu quả không nên quá nhiều. Nếu đặt quá nhiều chỉ số, nhóm thí điểm sẽ mất thời gian làm báo cáo thay vì cải tiến vận hành. Một bộ chỉ số tốt cần đủ bốn nhóm: hiệu suất, chất lượng, an toàn và khả năng mở rộng.
| Nhóm chỉ số | Chỉ số đề xuất | Cách đo | Ngưỡng tham khảo |
|---|---|---|---|
| Hiệu suất | Thời gian xử lý thao tác mục tiêu | So sánh trước và sau thí điểm | Giảm 20–30% ở cuối giai đoạn chạy thử |
| Chất lượng | Tỷ lệ đầu ra được duyệt sau chỉnh sửa nhẹ | Người kiểm duyệt phân loại mức chỉnh sửa | Từ 70% trở lên |
| An toàn | Số lỗi nghiêm trọng | Lỗi lộ dữ liệu, bịa thông tin, vượt thẩm quyền | Bằng 0 |
| Kiểm soát | Tỷ lệ đầu ra có nhật ký đầy đủ | Kiểm tra đầu vào, đầu ra, người duyệt, thời điểm | 100% |
| Người dùng | Mức hài lòng của cán bộ dùng thử | Khảo sát theo thang 1–5 | Từ 3,8/5 trở lên |
| Tri thức | Số tài liệu được chuẩn hóa | Danh mục tài liệu có nguồn, phiên bản, người xác nhận | Tăng đều qua từng giai đoạn |
| Mở rộng | Số điều kiện cần hoàn thiện trước khi nhân rộng | Danh sách điều kiện về dữ liệu, quy trình, vai trò | Có người phụ trách và thời hạn rõ |
Các ngưỡng trong bảng chỉ mang tính tham khảo. Với cơ quan mới bắt đầu, giảm 15% thời gian nhưng chuẩn hóa được kho tài liệu và phát hiện được lỗi quy trình cũng đã là kết quả có giá trị. Điều quan trọng là chỉ số phải được thống nhất trước khi chạy thử, không đặt sau khi đã có kết quả.
Mẫu báo cáo kết thúc thí điểm
Báo cáo kết thúc thí điểm nên ngắn, rõ, có số liệu và phục vụ quyết định. Một báo cáo quá dài nhưng thiếu bằng chứng sẽ không giúp lãnh đạo quyết định có nên mở rộng hay không. Cấu trúc báo cáo có thể gồm tám phần.
Phần thứ nhất là thông tin chung: tên trường hợp thí điểm, đơn vị thực hiện, thời gian, phạm vi và nhóm tham gia. Phần thứ hai là mục tiêu và chỉ số đã đặt. Phần thứ ba là mô tả Agent OS tối thiểu đã xây dựng, gồm kho tri thức, tiêu chuẩn, quy trình, vai trò, nhật ký và kiểm duyệt. Phần thứ tư là kết quả định lượng, gồm thời gian xử lý, tỷ lệ lỗi, tỷ lệ chỉnh sửa, số tài liệu chuẩn hóa và mức hài lòng.
Phần thứ năm là kết quả định tính, trong đó nêu tình huống AI xử lý tốt, tình huống xử lý kém và phản hồi của cán bộ. Phần thứ sáu là đánh giá rủi ro về dữ liệu, pháp lý, nghiệp vụ và an toàn thông tin. Phần thứ bảy là bài học và điều kiện mở rộng. Phần cuối cùng là kiến nghị: mở rộng, điều chỉnh hoặc dừng.
Mẫu báo cáo này giúp thí điểm trở thành một vòng học tập có kiểm soát. Dù kết quả là mở rộng hay dừng lại, cơ quan vẫn thu được tri thức quản trị: tài liệu nào cần chuẩn hóa, quy trình nào cần sửa, vai trò nào chưa rõ và chỉ số nào cần tiếp tục theo dõi.
Vai trò triển khai: đủ người, rõ trách nhiệm, không giao hết cho công nghệ thông tin
Một thí điểm Agent OS cần nhóm nhỏ nhưng đủ vai trò. Lãnh đạo bảo trợ chịu trách nhiệm định hướng, phê duyệt phạm vi và quyết định sau thí điểm. Chủ quy trình nghiệp vụ mô tả công việc, xác định đầu ra mong muốn và đánh giá giá trị thực tế. Văn phòng hoặc văn thư hỗ trợ chuẩn hóa văn bản, biểu mẫu, lịch xử lý và báo cáo. Pháp chế rà soát căn cứ, thẩm quyền và giới hạn sử dụng. Công nghệ thông tin thiết lập môi trường kỹ thuật, kết nối dữ liệu và hỗ trợ vận hành. An toàn thông tin kiểm soát quyền truy cập, dữ liệu nhạy cảm và nhật ký.
Điểm cần nhấn mạnh là không nên giao toàn bộ cho công nghệ thông tin. Nếu bộ phận kỹ thuật tự thiết kế thí điểm mà thiếu nghiệp vụ, đầu ra có thể đúng về kỹ thuật nhưng không dùng được trong hành chính. Nếu thiếu pháp chế, AI có thể vượt giới hạn thẩm quyền. Nếu thiếu văn phòng, tài liệu đầu vào có thể thiếu chuẩn. Nếu thiếu an toàn thông tin, dữ liệu có thể bị cấp quyền quá rộng.
Một cách làm hiệu quả là lập nhóm thí điểm liên ngành, họp ngắn hằng tuần, ghi nhận quyết định bằng biên bản ngắn và lưu mọi thay đổi vào nhật ký. Nhóm không cần đông, nhưng phải có đủ quyền tiếp cận tài liệu, quyền xin ý kiến lãnh đạo và quyền dừng thử nghiệm khi phát hiện rủi ro nghiêm trọng.
Cơ chế đánh giá: đánh giá theo bằng chứng, không theo cảm tính
Cơ chế đánh giá phải được thiết kế ngay từ đầu. Cơ quan cần có số liệu nền trước thí điểm, ví dụ thời gian trung bình để tóm tắt văn bản, số lỗi thường gặp trong báo cáo hoặc số lần cán bộ phải chỉnh sửa biểu mẫu. Khi có số liệu nền, kết quả sau thí điểm mới có ý nghĩa so sánh.
Đánh giá cũng cần tách rõ bốn lớp. Lớp nghiệp vụ xem đầu ra có dùng được không. Lớp pháp chế xem có vượt thẩm quyền hoặc thiếu căn cứ không. Lớp an toàn thông tin xem có rủi ro dữ liệu không. Lớp lãnh đạo xem thí điểm có tạo giá trị đủ để mở rộng không. Nếu chỉ để một nhóm tự đánh giá, kết quả dễ thiên lệch.
Điều quan trọng nhất là thí điểm phải cho ra quyết định rõ. Sau 90 ngày, cơ quan cần biết nên mở rộng, điều chỉnh hay dừng. Nếu không có quyết định, thí điểm sẽ trở thành hoạt động thử nghiệm kéo dài, không tạo năng lực tổ chức.
Hãy bắt đầu bằng một thí điểm 90 ngày, không triển khai đại trà ngay
Nếu cơ quan đang cân nhắc ứng dụng Agent OS, khuyến nghị thực tế nhất là: đừng triển khai đại trà ngay. Hãy chọn một trường hợp nhỏ, ít rủi ro, có dữ liệu rõ và có người kiểm duyệt. Sau đó, thiết kế thí điểm 90 ngày với sản phẩm đầu ra, chỉ số đo, vai trò và cơ chế đánh giá đầy đủ.
AIHanhChinhCong.vn và TS. Nguyễn Trung Hòa luôn đồng hành cùng cơ quan, địa phương và đơn vị chuyên môn trong việc lựa chọn trường hợp thí điểm, chuẩn hóa kho tri thức, xây câu lệnh chuẩn, thiết kế bảng kiểm duyệt, lập bộ chỉ số đo hiệu quả và xây mẫu báo cáo kết thúc thí điểm. Cách tiếp cận phù hợp với khu vực công không phải là làm thật lớn ngay, mà là làm nhỏ, chắc, đo được và có kiểm soát.
Thiết kế thí điểm Agent OS trong cơ quan hành chính là bước chuyển từ nhận thức sang hành động. Một thí điểm tốt không chỉ chứng minh AI có thể hỗ trợ công việc. Nó còn giúp cơ quan học cách chuẩn hóa tài liệu, mô tả quy trình, phân vai trách nhiệm, kiểm duyệt đầu ra, lưu nhật ký và đo hiệu quả.
Trong 90 ngày, cơ quan không cần giải quyết tất cả vấn đề. Cơ quan chỉ cần chọn một việc đúng, thiết kế hàng rào kiểm soát đúng, đo đúng chỉ số và ra quyết định đúng. Nếu làm được như vậy, thí điểm sẽ trở thành nền móng cho triển khai Agent OS rộng hơn trong tương lai.
Thông điệp cuối cùng rất rõ: hãy bắt đầu nhỏ, rõ, đo được và có kiểm soát. Đó là cách an toàn nhất để AI đi vào hoạt động hành chính công mà vẫn bảo vệ dữ liệu, trách nhiệm công vụ và niềm tin của người dân.

