Khoá học AI agent nhập môn: hiểu đúng trong 2 tiếng để khỏi bị loè

Khoá thứ mười trong loạt khoá học AI miễn phí của MONA, và là khoá “gọn mà chất” nhất loạt: nhập môn AI agent, dựng theo một giáo trình 2 tiếng thuần lý thuyết nền + kỹ thuật prompting nâng cao, không lệ thuộc nền tảng nào. Nếu các khoá trước dạy anh chị dùng từng công cụ (Claude Code, Antigravity, Cowork, n8n), khoá này dạy phần xương sống chung bên dưới tất cả: một agent thực chất vận hành ra sao, vì sao cùng một câu hỏi mỗi lần trả lời một kiểu, và bộ kỹ thuật khiến máy “đoán mò có xác suất” làm việc được như một đội ngũ kỷ luật. Học xong khoá này, anh chị nghe bất kỳ ai chào hàng “giải pháp AI agent” cũng tự bóc được ngay đồ thật đồ cúng: riêng khoản đó đã đáng 2 tiếng bỏ ra. Đây cũng là khoá tụi em khuyên đọc trước khi quyết định ngân sách AI cho công ty, vì phần cuối có luôn bài toán chi phí ít ai dạy.

Phần 1: AI agent là gì: vòng lặp ba nhịp và cái “định nghĩa xong” bị bỏ quên

Chatbot là một model ngôn ngữ trả lời câu hỏi. Agent = model + công cụ + trí nhớ + một vòng lặp theo đuổi mục tiêu tới cùng. Vòng lặp đó, bất kể nền tảng nào, đều là ba nhịp:

  1. Quan sát (Observe): đọc toàn bộ bối cảnh: file, kết quả các lần gọi công cụ trước, file luật (CLAUDE.md, GEMINI.md, AGENTS.md), dữ liệu hình ảnh âm thanh nếu có.
  2. Suy luận (Reason): từ bối cảnh và mục tiêu, tính bước kế tiếp. Các nền tảng tử tế đều cho bấm vào xem “dòng suy nghĩ” này: đó là cửa sổ để người giám sát nắn hướng.
  3. Hành động (Act): gọi công cụ, sửa file, chạy lệnh. Kết quả hành động đổ ngược về nhịp Quan sát: vòng lặp quay tiếp, bối cảnh phình dần.

Vòng quay dừng khi chạm “định nghĩa xong” (definition of done): bộ tiêu chí cho máy biết thế nào là hoàn thành. Và đây là lỗi số nhà của người dùng agent: giao việc mà không định nghĩa xong. “Làm cho tôi cái web thật đẹp” là đề bài không có đích: máy chạy mãi hoặc dừng bừa. “Trang giới thiệu một trang, có 4 khối này, chạy mượt trên điện thoại, dưới 500 dòng mã” là đề bài có đích: máy biết lúc nào được nghỉ. Anh chị để ý sẽ thấy mọi kỹ thuật của các khoá trước (định nghĩa “xong” trong chỉ thị DOE, luật dừng trong Cowork) đều là biến thể của đúng một nguyên lý này.

Vòng lặp ba nhịp của AI agent
Vòng lặp lõi của mọi agent: quan sát, suy luận, hành động, rồi đổ kết quả về quan sát tiếp. Vòng quay chỉ dừng khi chạm “định nghĩa xong”: giao việc thiếu định nghĩa xong là lỗi phổ biến bậc nhất.

Một ẩn dụ của giáo trình đáng kể lại vì nó chỉnh đúng kỳ vọng: model ngôn ngữ trần trụi giống một người thông minh của hai vạn năm trước, đứng giữa đồng cầm cây giáo: trí tuệ có thừa nhưng không nhà, không lửa, không công cụ, nên làm được rất ít. Agent là người đó được phát đủ đồ nghề và một việc để theo tới cùng. Nghĩa là: thấy AI “nói hay mà không được việc”, đa phần vấn đề không nằm ở não, nằm ở chỗ chưa ai phát cho nó công cụ và đích đến tử tế: hai thứ khoá này dạy cách phát.

Phần 2: Ba nền tảng lớn, và bảng so sánh nói thật

Ba cái tên thống trị mảng agent hiện nay: Claude Code (Anthropic), Codex (OpenAI), Antigravity với Gemini (Google). Giáo trình so sánh với đúng tinh thần tụi em thích: chênh lệch giữa các model đầu bảng chỉ vài phần trăm và đổi ngôi liên tục theo đợt huấn luyện, nên đừng thần thánh hoá đứa nào; cái đáng nhớ là nết riêng của từng đứa:

  • Claude: dòng suy nghĩ dễ đọc nhất, dễ can thiệp giữa chừng nhất → hợp làm nhạc trưởng điều phối và các việc cần giám sát chặt. Đổi lại chậm hơn (trừ khi bật chế độ nhanh, tốn hơn) và thiết kế giao diện thua Gemini.
  • Gemini: vô địch thiết kế giao diệnhiểu video gốc (xem video thật, không phải đọc phụ đề): hai món hai nhà kia còn đuối. Đổi lại dòng suy nghĩ khó đọc và phong độ trồi sụt theo ngày.
  • Codex (GPT): mạnh nhất mảng backend và toán, hợp kiểu giao việc “định nghĩa xong bằng bộ kiểm thử rồi thả tự chạy”.

Kết luận thực dụng của giáo trình: chọn một đứa dùng chính cũng ổn; còn đội hình mạnh nhất là dùng cả ba đúng nết: chuyện của phần 5. Về giá vé: cả ba đều quanh mức 17-20 đô một tháng cho gói vào cửa: anh chị theo loạt khoá này thì gói Claude Pro đã học được cả ba khoá nhà Claude, thêm Antigravity miễn phí là đủ giáo trình.

Phần 3: File luật tự tiến hoá: dạy máy một lần, nhớ mãi mãi

Anh chị đã quen file luật (CLAUDE.md, GEMINI.md, AGENTS.md: cùng một ý tưởng, mỗi nhà một tên) từ các khoá trước. Khoá này thêm một tầng rất đáng tiền: bắt agent tự ghi luật. Cài vào file luật một điều khoản: mỗi khi người dùng sửa lưng (bác một cách làm, chê một lựa chọn, bắt được một lỗi do máy tự đoán sai), agent phải tự thêm một dòng luật mới vào cuối file, theo khuôn “chủ đề: luôn/không bao giờ làm X, vì Y”. Ví dụ trong giáo trình: máy cứ làm web nền tối, người dùng gõ “thôi cái nết nền tối đi”: máy tự ghi luật “không bao giờ làm ứng dụng nền tối”, và từ phiên sau không tái phạm. Lần đầu dùng máy sai mười chỗ, lần thứ năm gần như không còn: lỗi của máy giảm dần theo thời gian dùng, y như nhân viên được kèm cặp tử tế: mà công kèm cặp chỉ là làm việc bình thường và để nó tự rút kinh nghiệm.

Kèm theo là cấu trúc phân tầng đáng chép: file luật toàn cục (áp mọi dự án: giọng điệu, nết chung), file luật từng dự án (riêng cho việc đó), rồi tới kỹ năng đóng gói, rồi mới tới câu lệnh từng lần. Tầng càng cao càng ít chữ nhưng sống càng lâu: đầu tư chữ vào đúng tầng là bí quyết dùng ít token mà máy vẫn thuộc bài.

File luật tự tiến hoá của agent
File luật tự tiến hoá: mỗi lần bị sửa lưng, agent tự ghi thêm một dòng “không bao giờ làm X vì Y”. Số lỗi giảm dần theo số lần dùng: đồ thị của một nhân viên được kèm cặp tử tế.

Phần 4: Hợp đồng đề bài và hỏi ngược: hai kỹ thuật chống “giao việc mơ hồ”

Hai kỹ thuật chị em cùng trị một bệnh: đề bài mơ hồ, thủ phạm đầu bảng khiến người ta thất vọng với agent.

  • Hợp đồng đề bài (prompt contract): trước khi làm bất kỳ việc không tầm thường nào, agent phải soạn một “hợp đồng” bốn mục trình người dùng duyệt: mục tiêu, ràng buộc, khuôn đầu ra, và điều kiện coi là hỏng. Mục cuối là mục thiên tài ít ai nghĩ tới: viết rõ “thế nào là hỏng” (nhìn như mẫu miễn phí đại trà, vỡ trên điện thoại, quá 500 dòng mã) chặn trước đúng những đường máy hay trượt.
  • Hỏi ngược (reverse prompting): dặn agent: nhận việc xong, hỏi lại 5 câu làm rõ trước khi động tay: mục tiêu chính là gì, giả định ngầm nào cần xác nhận, khẩu vị thẩm mỹ theo hướng nào. Người dùng trả lời 2 phút, xác suất “một phát ăn ngay” nhảy vọt. Anh chị gặp mẹo này ở khoá Claude rồi (“trước khi làm, hỏi tôi những gì còn thiếu”): đây là bản đầy đủ của nó, và hai kỹ thuật xếp chuỗi được: hỏi ngược trước, đổ câu trả lời vào hợp đồng sau.

Phần 5: Đội hình nhiều model: bộ định tuyến và dàn nhạc MCP

Món nặng ký nhất phần kỹ thuật: cho một model làm nhạc trưởng, điều các model khác qua giao thức MCP. Kiến trúc: Claude đứng giữa nhận việc, bẻ nhỏ, rồi giao đúng nết từng đứa: giao diện đưa Gemini, backend và kiểm thử đưa Codex, việc cần xem video đưa Gemini (vì hiểu video gốc), cần dữ liệu web tươi thì gọi thêm dịch vụ tìm kiếm; xong nhạc trưởng gom bài, soát chéo, vá chỗ vênh. Cái hay kép: vừa song song hoá (các nhánh chạy cùng lúc), vừa mỗi việc được model giỏi nhất việc đó làm, vừa nhạc trưởng chấm bài với con mắt không bị “ô nhiễm” bởi bối cảnh các nhánh. Cái giá phải biết: đi đường API trực tiếp là mất phần “bao cấp” của gói tháng (gói cố định của các hãng đáng giá gấp nhiều lần tiền vé nếu quy ra giá API lẻ), nên đội hình nhiều model chỉ đáng bật cho việc xứng tầm.

Đội hình song song còn một biến thể “cơ bắp” rất dễ hình dung: nhân bản trình duyệt. Bài toán thật trong giáo trình: điền form liên hệ trên 1.000 website đối tác, mỗi form một agent tự mở trình duyệt, tự tìm form, tự điền, tự gửi: một agent làm tuần tự mất hơn 30 giờ; phái 100 agent song song, mỗi đứa một cửa sổ trình duyệt riêng, báo cáo về một file chung cho nhạc trưởng điểm danh: còn 40 phút. Cùng nguyên lý áp được cho tra cứu giá, kiểm tồn hàng loạt trang, đối soát danh bạ: chỗ nào việc lặp giống hệt nhau trên nhiều đích, chỗ đó song song hoá ăn tiền. Kèm lời dặn đạo đức mà tụi em ký cả hai tay: sức mạnh này không phải giấy phép đi quét phá dữ liệu nhà người khác: dùng trong ranh giới điều khoản của từng nền tảng.

Ứng dụng phái sinh rất đời: từ video ra hành động. Máy không tự xem được video hướng dẫn? Cho Gemini xem hộ: nó bóc video thành danh sách bước chi tiết tới từng giây, trả về cho Claude cầm danh sách đó làm theo thật trên máy. Giáo trình demo bằng một video hướng dẫn 21 phút: máy xem, bóc bước, rồi tự dựng lại nguyên quy trình trong công cụ thật cho tới khi chạy. Kho video hướng dẫn khổng lồ trên mạng, từ nay, là kho quy trình máy học được trực tiếp.

Đội hình nhiều model với bộ định tuyến
Đội hình nhiều model: nhạc trưởng nhận việc, bẻ nhỏ, giao đúng nết từng model rồi gom bài soát chéo. Giao diện về Gemini, backend về Codex, điều phối và tổng hợp về Claude.

Phần 6: Sức mạnh của số đông có kỷ luật: đồng thuận, tranh luận, và vòng soát ba vai

Phần này trả lời câu hỏi nền tảng nhất: máy trả lời mỗi lần một kiểu (tính ngẫu nhiên thống kê), vậy làm sao ra quyết định tin được? Câu trả lời: đừng hỏi một lần: tổ chức số đông có kỷ luật, ba đội hình:

  • Đồng thuận thống kê: phái 10 agent chạy song song cùng một câu hỏi chiến lược, mỗi đứa một khung nhìn hơi khác (bảo thủ, ngân sách hẹp, chỉ tin thứ đo được, góc người dùng cuối…). Gom kết quả thành ba rổ: đồng thuận (đa số trùng nhau: độ tin cao, làm được), bất đồng (cần nghĩ thêm), và dị biệt (chỉ 1/10 đứa nói: hoặc là ý tưởng lóe sáng, hoặc là bịa: người quyết). Chi phí thật của giáo trình cho một cụm 10 agent phân tích chiến lược: cỡ 3-4 đô: rẻ hơn bất kỳ buổi họp nào từng tổ chức. Ca thật trong giáo trình càng dễ thấm: một kênh nội dung mạnh ở hai nền tảng nhưng bết ở nền tảng thứ ba, hỏi 10 agent “vì sao và làm gì”: rổ đồng thuận chỉ ra nội dung đang bê nguyên định dạng của nền tảng cũ sang (phải làm lại câu mở theo nết nền tảng mới), rổ dị biệt có một đứa gợi ý đường quảng cáo trả phí không ai nghĩ tới. Người quyết vẫn là người: nhưng chưa bao giờ người quyết được cầm bản đồ đủ góc nhìn với giá một ly cà phê như vậy.
  • Phòng tranh luận: gán cho mỗi agent một tính cách (người nhìn hệ thống, người thực dụng, người săn ca oái oăm, người bênh người dùng, người chuyên cãi) rồi cho tranh luận vòng tròn trong một file chung. Ý kiến ra “gắt” hơn hẳn kiểu chạy song song im lặng, và biên bản tranh luận là tài liệu quý cho người quyết.
  • Vòng soát ba vai: người làm → người soát (bối cảnh sạch, chỉ nhìn sản phẩm, không biết quá trình: miễn nhiễm với “tâm lý tiếc công” khiến máy tự chấm mình điểm cao) → người sửa. Demo thật: bản soát bối cảnh sạch bắt được 22 lỗi trong một codebase mà chính máy làm ra đã tự tin là ổn. Đây chính là phiên bản đầy đủ của nghi thức “soát bằng phiên sạch” anh chị học suốt loạt.
Kỹ thuật đồng thuận 10 agent
Đồng thuận thống kê: 10 agent, 10 khung nhìn, gom về ba rổ đồng thuận, bất đồng, dị biệt. Trị đúng gốc bệnh “mỗi lần trả lời một kiểu” bằng số đông có kỷ luật, giá 3-4 đô một cụm.

Phần 7: Trí nhớ máy và túi tiền: tảng băng, nén bối cảnh, và luật 60-30-10

Hai chuyện nghe kỹ thuật mà thật ra là chuyện tiền:

  • Bối cảnh là tài nguyên đắt: cửa sổ trí nhớ model cỡ 200 nghìn tới 1 triệu token, nhưng chất lượng tụt dần khi bối cảnh đầy lên, và mọi thứ nạp vào đều tính tiền: file luật, kỹ năng, lịch sử chat. Chiến lược chuẩn là tảng băng: phần nổi luôn kèm theo (file luật, việc đang làm) giữ thật gọn cỡ 20-30%; phần chìm (cả kho code, lịch sử, tài liệu) để máy tự lặn xuống lấy khi cần qua các công cụ đọc và tìm kiếm. Các nền tảng đều có lệnh soi bối cảnh (kiểu /context) và cơ chế tự nén khi gần đầy: nén là mất chi tiết, nên việc dài phải có “biên bản bàn giao” như anh chị đã học.
  • Luật 60-30-10: đừng bắt model đắt nhất làm mọi việc. Một bộ định tuyến chia việc: cỡ 60% khối lượng (việc cơ bắp: phân loại, bóc dữ liệu) cho model rẻ nhất, 30% (việc vừa: tổng hợp, viết nháp) cho model tầm trung, 10% (việc khó nhất và chính việc định tuyến) cho model đỉnh. Phép tính minh hoạ của giáo trình: cùng khối việc, chạy toàn model đỉnh tốn 500 đô, chia bậc còn 200 đô: tiết kiệm 60% không giảm chất lượng, vì việc dễ vốn không cần não to. Ca thật đi kèm: dây quét và chăm sóc khách chạy hằng ngày, chia bậc xong chi phí mỗi khách còn non 3 xu, so với 12 xu nếu chơi sang toàn phần: một tháng chênh nhau vài trăm đô chỉ nhờ xếp việc đúng người.
Luật 60-30-10 chia việc theo bậc model
Luật 60-30-10: model rẻ gánh 60% việc cơ bắp, tầm trung 30%, model đỉnh chỉ giữ 10% việc khó nhất cộng vai trò định tuyến. Cùng khối việc, hoá đơn giảm già nửa mà chất lượng giữ nguyên.

Phần 8: Áp vào doanh nghiệp: ba lớp giá trị, và ranh giới quen thuộc

Gom cả khoá lại, với người điều hành, giá trị nằm ở ba lớp. Lớp một: mua sắm khôn hơn. Anh chị giờ có bộ câu hỏi bóc hàng khi nghe chào “AI agent”: vòng lặp dừng theo định nghĩa xong nào, file luật tiến hoá ra sao, ai soát bằng bối cảnh sạch, chi phí chia bậc model chưa. Nhà cung cấp trả lời trôi chảy bốn câu đó là hàng thật. Lớp hai: dùng nội bộ khôn hơn. Hợp đồng đề bài và hỏi ngược áp được ngay cho mọi nhân viên đang dùng AI, không cần hạ tầng gì; luật 60-30-10 áp được ngay cho hoá đơn API nếu công ty đã có hệ thống chạy AI. Lớp ba: nền để xây. Các kỹ thuật số đông (đồng thuận, tranh luận, vòng soát) là thứ tụi em dùng thật trong các hệ thống lớn: chúng biến AI từ “một nhân viên giỏi thất thường” thành “một hội đồng có quy chế”.

Và ranh giới, lần cuối cho trọn loạt: khoá này cho anh chị ngôn ngữ và bản đồ; xây hệ agent chạy nghiệp vụ thật cho doanh nghiệp vẫn là bài toán kỹ nghệ: phân quyền, nhật ký, chịu tải, người chịu trách nhiệm: đúng nghề hơn 10 năm với 14.000+ dự án của MONA. Anh chị muốn biến bản đồ thành cỗ máy cho chính công ty mình: gọi 1900 636 648 hoặc gửi về info@themona.global, tụi em nghe đề bài, vẽ kiến trúc, báo giá minh bạch ký giá nào làm đúng giá đó.

Hỏi nhanh đáp gọn

AI agent khác chatbot chỗ nào? Chatbot là model trả lời câu hỏi. Agent là model cộng công cụ, trí nhớ và vòng lặp quan sát, suy luận, hành động, tự chạy tới khi chạm “định nghĩa xong”. Một bên nói, một bên làm.

Nên bắt đầu với nền tảng nào? Một trong ba: Claude Code (dễ giám sát, hợp điều phối), Antigravity với Gemini (miễn phí, mạnh giao diện), Codex (mạnh backend). Loạt khoá của tụi em có bài riêng cho từng đứa; chênh lệch giữa chúng nhỏ hơn quảng cáo nhiều.

Không rành kỹ thuật có học được khoá này không? Được, vì đây là khoá tư duy: vòng lặp, hợp đồng đề bài, hỏi ngược, luật chi phí đều là chuyện quản trị, không phải chuyện code. Phần kỹ thuật sâu (MCP, điều phối nhiều model) hiểu khái niệm là đủ dùng.

Vì sao AI mỗi lần trả lời một kiểu, có sửa được không? Bản chất model là máy xác suất, không “sửa” được tính đó: nhưng trị được bằng tổ chức: định nghĩa xong rõ, hợp đồng đề bài, và các đội hình số đông (đồng thuận, tranh luận, vòng soát ba vai) như phần 6.

Chi phí chạy agent có đắt không? Tuỳ cách xếp việc. Gói tháng 17-20 đô đủ cho cá nhân dùng sâu. Hệ thống chạy khối lượng lớn thì áp luật 60-30-10: model rẻ gánh việc cơ bắp, model đỉnh chỉ giữ việc khó: hoá đơn thường giảm quá nửa so với chơi sang toàn phần.

Khoá tiếp theo của loạt: dựng việc kinh doanh AI đầu tiên: đem toàn bộ đồ nghề đã học đi kiếm khách hàng trả tiền. Hẹn ở đó.

MONA có podcast — nghe thay vì đọcCác tập về AI, tự động hoá & SEO cho doanh nghiệp Việt
Nghe ngay
Về tác giả

CEO & Founder · The MONA

Người sáng lập The MONA, xây dựng công ty dịch vụ 200+ nhân sự với 14.000+ dự án đã triển khai. Khánh Hùng chia sẻ tư duy xây hệ thống tự chạy, tự động hoá doanh nghiệp và những bài học triển khai thật phía sau MONA.

Lượt xem 82
Đánh giá bài viết 4,6/5 · 17 đánh giá

Bài viết liên quan

Dịch vụ thiết kế
website chuyên nghiệp

Sở hữu website với giao diện đẹp, độc quyền 100%, bảo hành trọn đời với khả năng
mở rộng tính năng linh hoạt theo sự phát triển doanh nghiệp ngay hôm nay!

Liên hệ Mona

    MONA có riêng một Người "Bạn Thân" cho bạn - Người Account sẽ đồng hành, hỗ trợ, hướng dẫn, đặt đồ ăn cho bạn mãi mãi, từ đây về sau!
    MONA cam kết tuyệt đối không sử dụng thông tin của bạn để bán hoặc SPAM
    Đội MONA tư vấn hệ thống quản lý giáo dục trực tuyến
    Hỏi đáp giáo dục 4.0
    Tạo cuộc hẹn miễn phí với MONA để giải đáp và tư vấn mọi thắc mắc về giải pháp số hoá ngành giáo dục
    Thời lượng cuộc hẹn
    45 Phút
    Ngày và giờ
    Thứ 2, ngày 25 tháng 12, 2023
    [9:30 - 10:15]

      Chọn ngày và giờ
      Khung giờ
      Quay lại
      Hãy cho MONA biết bạn là ai
      0:00