8/8/2025 (TinAI.vn) – GPT-5, mô hình flagship mới nhất của OpenAI, đại diện cho một bước tiến vượt bậc về hiệu suất thực thi tác vụ tự hành (agentic), lập trình, trí tuệ thô và khả năng điều khiển.[1]
OpenAI tin rằng mô hình sẽ hoạt động xuất sắc “ngay từ khi ra mắt” trên nhiều lĩnh vực, trong hướng dẫn này, chúng ta sẽ đề cập đến các mẹo viết prompt để tối đa hóa chất lượng đầu ra của mô hình. Các mẹo này được rút ra từ kinh nghiệm của OpenAI trong việc huấn luyện và áp dụng mô hình vào các tác vụ thực tế. Chúng ta sẽ thảo luận về các khái niệm như cải thiện hiệu suất tác vụ tự hành, đảm bảo tuân thủ hướng dẫn, tận dụng các tính năng API mới, và tối ưu hóa lập trình cho các tác vụ frontend và kỹ thuật phần mềm – với những hiểu biết quan trọng từ công việc tinh chỉnh prompt cho GPT-5 của trình soạn thảo mã nguồn AI Cursor.[1]
OpenAI khẳng định đã có những cải tiến đáng kể khi áp dụng các phương pháp hay nhất này và sử dụng các công cụ tiêu chuẩn của họ bất cứ khi nào có thể. Hy vọng rằng hướng dẫn này, cùng với công cụ tối ưu hóa prompt mà OpenAI đã xây dựng, sẽ là bệ phóng cho việc sử dụng GPT-5 của bạn. Tuy nhiên, hãy nhớ rằng việc viết prompt không phải là một giải pháp chung cho tất cả – khuyến khích bạn nên thử nghiệm và lặp lại dựa trên nền tảng được cung cấp ở đây để tìm ra giải pháp tốt nhất cho vấn đề của mình.[1]
Khả năng dự đoán trong quy trình công việc tự hành (Agentic workflow predictability)
OpenAI đã huấn luyện GPT-5 với mục tiêu hướng đến các nhà phát triển: chúng tôi tập trung vào việc cải thiện khả năng gọi công cụ, tuân thủ hướng dẫn và hiểu ngữ cảnh dài để tạo ra một mô hình nền tảng tốt nhất cho các ứng dụng tự hành. Nếu áp dụng GPT-5 cho các luồng công việc tự hành và gọi công cụ, chúng tôi khuyến nghị nâng cấp lên Responses API, nơi logic suy luận được duy trì giữa các lần gọi công cụ, dẫn đến kết quả đầu ra hiệu quả và thông minh hơn.[1]
Kiểm soát mức độ chủ động (Eagerness) của tác nhân tự hành
Các hệ thống tự hành có thể hoạt động trên một phổ kiểm soát rộng—một số hệ thống giao phần lớn việc ra quyết định cho mô hình, trong khi những hệ thống khác giữ mô hình trong tầm kiểm soát chặt chẽ với logic phân nhánh lập trình dày đặc. GPT-5 được huấn luyện để hoạt động ở bất kỳ đâu trên phổ này, từ việc đưa ra quyết định cấp cao trong các tình huống mơ hồ đến xử lý các tác vụ tập trung, được xác định rõ ràng. Trong phần này, chúng ta sẽ đề cập đến cách hiệu chỉnh tốt nhất mức độ chủ động của GPT-5: nói cách khác, sự cân bằng giữa tính chủ động và việc chờ đợi hướng dẫn rõ ràng.[1]
Prompting để giảm mức độ chủ động:
Mặc định, GPT-5 rất kỹ lưỡng và toàn diện khi cố gắng thu thập ngữ cảnh trong một môi trường tự hành để đảm bảo nó sẽ đưa ra câu trả lời chính xác. Để giảm phạm vi hành vi tự hành của GPT-5—bao gồm việc hạn chế các hành động gọi công cụ không liên quan và giảm thiểu độ trễ để đi đến câu trả lời cuối cùng—hãy thử những cách sau:[1]
-
Chuyển sang reasoning_effort (nỗ lực suy luận) thấp hơn. Điều này làm giảm độ sâu khám phá nhưng cải thiện hiệu quả và độ trễ.[1]
-
Xác định các tiêu chí rõ ràng trong prompt của bạn về cách bạn muốn mô hình khám phá không gian vấn đề. Điều này làm giảm nhu cầu của mô hình trong việc khám phá và suy luận về quá nhiều ý tưởng.[1]
<context_gathering>
Mục tiêu: Thu thập đủ bối cảnh nhanh chóng. Thực hiện khám phá song song (parallelize discovery) và dừng ngay khi có đủ thông tin để hành động.Phương pháp:
Bắt đầu từ phạm vi rộng, sau đó mở rộng sang các truy vấn con (subquery) tập trung hơn.
Thực hiện đồng thời nhiều truy vấn khác nhau; đọc các kết quả hàng đầu (top hits) của mỗi truy vấn. Loại bỏ đường dẫn trùng lặp (deduplicate paths) và lưu vào bộ nhớ đệm (cache); không lặp lại truy vấn.
Tránh tìm kiếm quá mức để lấy bối cảnh. Nếu cần, thực hiện tìm kiếm có mục tiêu (targeted search) trong một lô song song (parallel batch).
Tiêu chí dừng sớm:
Có thể chỉ rõ chính xác nội dung cần thay đổi.
Các kết quả hàng đầu hội tụ (converge) khoảng ~70% vào cùng một khu vực hoặc đường dẫn.
Nâng cấp một lần:
Nếu tín hiệu mâu thuẫn (signals conflict) hoặc phạm vi chưa rõ, chạy một lô song song tinh chỉnh (refined parallel batch), sau đó tiếp tục.
Độ sâu:
Chỉ truy vết (trace) các ký hiệu (symbol) sẽ chỉnh sửa hoặc các hợp đồng ràng buộc (contract) phụ thuộc; tránh mở rộng dây chuyền (transitive expansion) trừ khi cần thiết.
Chu trình:
Tìm kiếm theo lô (batch search) → lập kế hoạch tối giản (minimal plan) → hoàn thành nhiệm vụ.
Tìm kiếm lại chỉ khi bước xác minh thất bại (validation fails) hoặc xuất hiện thông tin chưa biết mới (new unknowns). Ưu tiên hành động hơn là tìm kiếm thêm.
</context_gathering>
Bạn thậm chí có thể đặt ngân sách gọi công cụ cố định, như ví dụ dưới đây, để kiểm soát chặt chẽ hơn.[1]
<context_gathering>
Độ sâu tìm kiếm (search depth): rất thấp.
Ưu tiên mạnh mẽ việc đưa ra câu trả lời đúng càng nhanh càng tốt, ngay cả khi có thể chưa hoàn toàn chính xác.
Thông thường, điều này nghĩa là tối đa tuyệt đối 2 lần gọi công cụ (tool calls).
Nếu bạn cho rằng cần thêm thời gian để điều tra, hãy cập nhật cho người dùng về các phát hiện mới nhất và các câu hỏi còn bỏ ngỏ. Bạn có thể tiếp tục nếu người dùng xác nhận.
</context_gathering>
Prompting để tăng mức độ chủ động:
Ngược lại, nếu bạn muốn khuyến khích sự tự chủ của mô hình, tăng cường sự bền bỉ trong việc gọi công cụ và giảm các câu hỏi làm rõ, OpenAI khuyến nghị tăng reasoning_effort và sử dụng một prompt như sau để khuyến khích sự bền bỉ và hoàn thành nhiệm vụ một cách kỹ lưỡng.[1]
<persistence> – Bạn là một tác nhân (*agent*) — hãy tiếp tục cho đến khi truy vấn của người dùng được giải quyết hoàn toàn trước khi kết thúc lượt và trả lại quyền cho người dùng. – Chỉ kết thúc lượt khi bạn chắc chắn rằng vấn đề đã được giải quyết. – Không bao giờ dừng hoặc trả lại quyền cho người dùng khi gặp sự không chắc chắn — hãy nghiên cứu hoặc suy luận để tìm ra cách tiếp cận hợp lý nhất và tiếp tục. – Không yêu cầu người dùng xác nhận hoặc làm rõ các giả định, vì bạn luôn có thể điều chỉnh sau — hãy quyết định giả định hợp lý nhất, tiến hành theo giả định đó và ghi chú lại cho người dùng sau khi hoàn thành. </persistence>
Nhìn chung, việc nêu rõ điều kiện dừng của các tác vụ tác nhân, phác thảo các hành động an toàn và không an toàn, và xác định thời điểm, nếu có, thì mô hình có thể được trả về cho người dùng. Ví dụ: trong một bộ công cụ mua sắm, công cụ thanh toán và thanh toán nên có ngưỡng không chắc chắn thấp hơn để yêu cầu người dùng làm rõ, trong khi công cụ tìm kiếm nên có ngưỡng cực kỳ cao; tương tự, trong thiết lập mã hóa, công cụ xóa tệp nên có ngưỡng thấp hơn nhiều so với công cụ tìm kiếm grep.
Lời tựa cho Công cụ (Tool Preambles)
Open AI cho biết rằng trên các quỹ đạo tác nhân được người dùng giám sát, việc mô hình cập nhật không liên tục về những gì nó đang làm với các lệnh gọi công cụ và lý do tại sao có thể mang lại trải nghiệm tương tác tốt hơn nhiều cho người dùng – thời gian triển khai càng dài, sự khác biệt mà những cập nhật này tạo ra càng lớn. Để đạt được mục tiêu này, GPT-5 được đào tạo để cung cấp các kế hoạch ban đầu rõ ràng và cập nhật tiến độ nhất quán thông qua các thông báo “phần mở đầu công cụ”.
Bạn có thể điều chỉnh tần suất, phong cách và nội dung của phần mở đầu công cụ trong lời nhắc của mình—từ những giải thích chi tiết về từng lệnh gọi công cụ đến một kế hoạch ngắn gọn ban đầu và mọi thứ khác. Đây là một ví dụ về một lời nhắc mở đầu chất lượng cao.[1]
<tool_preambles>
Luôn bắt đầu bằng cách diễn giải lại mục tiêu của người dùng theo cách thân thiện, rõ ràng và súc tích, trước khi gọi bất kỳ công cụ nào (tools).
Tiếp đó, lập ngay một kế hoạch có cấu trúc, nêu chi tiết từng bước logic bạn sẽ thực hiện.
Khi tiến hành các chỉnh sửa tệp (file edit), hãy tường thuật ngắn gọn theo đúng trình tự, và đánh dấu tiến độ rõ ràng.
Kết thúc bằng cách tóm tắt phần công việc đã hoàn thành, tách biệt rõ ràng với kế hoạch ban đầu.
</tool_preambles>
Sau đây là ví dụ về phần mở đầu công cụ có thể được phát ra để đáp lại lời nhắc như vậy—phần mở đầu như vậy có thể cải thiện đáng kể khả năng của người dùng trong việc theo dõi công việc của tác nhân khi công việc trở nên phức tạp hơn:
“output”: [
{
“id”: “rs_6888f6d0606c819aa8205ecee386963f0e683233d39188e7”,
“type”: “reasoning”,
“summary”: [
{
“type”: “summary_text”,
“text”: “**Determining weather response**\n\nI need to answer the user’s question about the weather in San Francisco. ….”
},
},
{
“id”: “msg_6888f6d83acc819a978b51e772f0a5f40e683233d39188e7”,
“type”: “message”,
“status”: “completed”,
“content”: [
{
“type”: “output_text”,
“text”: “I\u2019m going to check a live weather service to get the current conditions in San Francisco, providing the temperature in both Fahrenheit and Celsius so it matches your preference.”
}
],
“role”: “assistant”
},
{
“id”: “fc_6888f6d86e28819aaaa1ba69cca766b70e683233d39188e7”,
“type”: “function_call”,
“status”: “completed”,
“arguments”: “{\”location\”:\”San Francisco, CA\”,\”unit\”:\”f\”}”,
“call_id”: “call_XOnF4B9DvB8EJVB3JvWnGg83”,
“name”: “get_weather”
},
],
Nỗ lực suy luận (Reasoning Effort)
OpenAI cung cấp tham số reasoning_effort để kiểm soát mức độ suy nghĩ của mô hình và sự sẵn lòng gọi công cụ; mặc định là medium (trung bình), nhưng bạn nên tăng hoặc giảm tùy thuộc vào độ khó của tác vụ. Đối với các tác vụ phức tạp, nhiều bước, chúng tôi khuyến nghị reasoning_effort cao hơn để đảm bảo kết quả tốt nhất có thể.[1]
Tái sử dụng ngữ cảnh suy luận với Responses API
Chúng tôi đặc biệt khuyến nghị sử dụng Responses API khi dùng GPT-5 để mở khóa các luồng tự hành được cải thiện, chi phí thấp hơn và sử dụng token hiệu quả hơn. Chúng tôi đã thấy sự cải thiện đáng kể về mặt thống kê trong các bài đánh giá khi sử dụng Responses API so với Chat Completions—ví dụ, điểm số Taubench-Retail tăng từ 73.9% lên 78.2% chỉ bằng cách chuyển sang Responses API và bao gồm previous_response_id để truyền lại các mục suy luận trước đó vào các yêu cầu tiếp theo.[1]
Tối đa hóa hiệu suất lập trình, từ lập kế hoạch đến thực thi
GPT-5 dẫn đầu tất cả các mô hình tiên tiến về khả năng lập trình: nó có thể làm việc trong các codebase lớn để sửa lỗi, xử lý các thay đổi lớn (diffs), và triển khai các tính năng mới hoặc tái cấu trúc nhiều tệp. Nó cũng xuất sắc trong việc triển khai các ứng dụng hoàn toàn mới từ đầu, bao gồm cả frontend và backend.[1]
Phát triển ứng dụng Frontend
GPT-5 được huấn luyện để có gu thẩm mỹ tốt cùng với khả năng triển khai nghiêm ngặt. Chúng tôi tự tin vào khả năng của nó trong việc sử dụng tất cả các loại framework và gói phát triển web. Tuy nhiên, đối với các ứng dụng mới, chúng tôi khuyến nghị sử dụng các framework và gói sau để tận dụng tối đa khả năng frontend của mô hình:
-
Frameworks: Next.js (TypeScript), React, HTML.[1]
-
Styling / UI: Tailwind CSS, shadcn/ui, Radix Themes.[1]
-
Icons: Material Symbols, Heroicons, Lucide.[1]
-
Animation: Motion.[1]
-
Fonts: San Serif, Inter, Geist, Mona Sans, IBM Plex Sans, Manrope.[1]
Vòng lặp tự phản ánh/sửa lỗi
GPT-5 rất giỏi trong việc xây dựng ứng dụng trong một lần. Người dùng đã nhận thấy rằng việc yêu cầu mô hình tự xây dựng một bộ tiêu chí đánh giá (rubric) và sau đó tự đánh giá, lặp lại để tạo ra giải pháp tốt nhất sẽ cải thiện chất lượng đầu ra.[1]
Lập trình cộng tác trong môi trường sản xuất: Tinh chỉnh prompt GPT-5 của Cursor
Chúng tôi tự hào có trình soạn thảo mã nguồn AI Cursor là một đối tác thử nghiệm alpha đáng tin cậy cho GPT-5. Dưới đây là một cái nhìn về cách Cursor đã tinh chỉnh các prompt của họ để khai thác tối đa khả năng của mô hình.[1]
-
Tinh chỉnh System Prompt và tham số: System prompt của Cursor tập trung vào việc gọi công cụ đáng tin cậy, cân bằng giữa sự dài dòng và hành vi tự chủ. Nhóm nghiên cứu ban đầu thấy rằng mô hình tạo ra các kết quả dài dòng. Để tìm sự cân bằng tốt hơn, họ đã đặt tham số API verbosity (độ dài dòng) thành low (thấp) để giữ cho các đầu ra văn bản ngắn gọn, và sau đó sửa đổi prompt để khuyến khích mạnh mẽ các kết quả dài dòng chỉ trong các công cụ lập trình.[1]
-
Xử lý các vấn đề: Cursor cũng nhận thấy rằng mô hình đôi khi trì hoãn để hỏi người dùng làm rõ trước khi hành động. Để giải quyết vấn đề này, họ thấy rằng việc bao gồm không chỉ các công cụ có sẵn và ngữ cảnh xung quanh mà còn nhiều chi tiết hơn về hành vi sản phẩm đã khuyến khích mô hình thực hiện các tác vụ dài hơn với sự gián đoạn tối thiểu và tự chủ cao hơn.[1]
Tối ưu hóa trí tuệ và khả năng tuân thủ hướng dẫn
Điều khiển (Steering)
Là mô hình dễ điều khiển nhất của chúng tôi, GPT-5 cực kỳ nhạy bén với các hướng dẫn trong prompt liên quan đến độ dài dòng, giọng điệu và hành vi gọi công cụ.[1]
Độ dài dòng (Verbosity)
Ngoài việc có thể kiểm soát reasoning_effort như trong các mô hình suy luận trước đây, trong GPT-5, chúng tôi giới thiệu một tham số API mới gọi là verbosity, ảnh hưởng đến độ dài của câu trả lời cuối cùng của mô hình, thay vì độ dài của quá trình suy nghĩ của nó.[1]
Tuân thủ hướng dẫn
Giống như GPT-4.1, GPT-5 tuân thủ các hướng dẫn trong prompt với độ chính xác phẫu thuật. Tuy nhiên, hành vi tuân thủ hướng dẫn cẩn thận của nó có nghĩa là các prompt được xây dựng kém chứa các hướng dẫn mâu thuẫn hoặc mơ hồ có thể gây hại cho GPT-5 nhiều hơn so với các mô hình khác, vì nó tốn các token suy luận để tìm cách giải quyết các mâu thuẫn thay vì chọn một hướng dẫn ngẫu nhiên.[1]
Suy luận tối thiểu (Minimal reasoning)
Trong GPT-5, chúng tôi lần đầu tiên giới thiệu minimal reasoning effort: tùy chọn nhanh nhất của chúng tôi mà vẫn gặt hái được lợi ích của mô hình suy luận. Chúng tôi coi đây là bản nâng cấp tốt nhất cho người dùng nhạy cảm với độ trễ, cũng như người dùng hiện tại của GPT-4.1.[1]
Ví dụ: Nhớ rằng bạn là một tác nhân (agent) — hãy tiếp tục cho đến khi truy vấn của người dùng được giải quyết hoàn toàn, rồi mới kết thúc lượt và trả lại quyền cho người dùng. Hãy chia nhỏ yêu cầu của người dùng thành tất cả các yêu cầu con (sub-request), và xác nhận rằng từng phần đã hoàn tất. Đừng dừng lại sau khi chỉ hoàn thành một phần của yêu cầu. Chỉ kết thúc lượt khi bạn chắc chắn vấn đề đã được giải quyết. Bạn phải sẵn sàng trả lời nhiều truy vấn và chỉ kết thúc khi người dùng xác nhận là đã xong.
Bạn phải lập kế hoạch thật kỹ theo đúng các bước quy trình (workflow steps) trước khi thực hiện các lời gọi hàm tiếp theo (function calls), và đánh giá kỹ lưỡng kết quả của từng lời gọi hàm để bảo đảm truy vấn của người dùng cùng mọi yêu cầu con liên quan được giải quyết hoàn toàn.
Định dạng Markdown
Mặc định, GPT-5 trong API không định dạng câu trả lời cuối cùng của nó bằng Markdown. Tuy nhiên, các prompt yêu cầu định dạng Markdown thường thành công trong việc tạo ra các câu trả lời có cấu trúc Markdown phân cấp.[1]
Chỉ sử dụng Markdown ở những vị trí phù hợp về ngữ nghĩa (ví dụ:
inline code,code fences, danh sách, bảng).Khi dùng Markdown trong tin nhắn của trợ lý, hãy dùng dấu backtick để định dạng tên tệp (file), thư mục (directory), hàm (function), và lớp (class).
Sử dụng vaˋvà cho công thức toán nội dòng (inline math), vaˋvà cho công thức toán dạng khối (block math).
Metaprompting
Cuối cùng, một điểm đáng chú ý là những người thử nghiệm sớm đã thành công lớn khi sử dụng chính GPT-5 như một công cụ “meta-prompter” cho chính nó. Bạn có thể yêu cầu GPT-5 đề xuất các chỉnh sửa cho một prompt không thành công để gợi ra hành vi mong muốn, hoặc loại bỏ các yếu tố để ngăn chặn hành vi không mong muốn.[1] Dưới đây là một ví dụ về mẫu metaprompt:
Khi được yêu cầu tối ưu hóa (optimize) một prompt, hãy trả lời từ góc nhìn của chính bạn — giải thích những cụm từ cụ thể nào có thể được thêm vào hoặc xóa khỏi prompt này để nhất quán hơn trong việc tạo ra hành vi mong muốn hoặc ngăn chặn hành vi không mong muốn.
Đây là một prompt: [PROMPT]
Hành vi mong muốn (desired behavior) từ prompt này là để tác nhân (agent) [DO DESIRED BEHAVIOR], nhưng thay vào đó nó lại [DOES UNDESIRED BEHAVIOR]. Trong khi giữ nguyên nhiều nhất có thể nội dung hiện tại của prompt, những chỉnh sửa hoặc bổ sung tối thiểu nào bạn sẽ thực hiện để khuyến khích tác nhân giải quyết nhất quán hơn những thiếu sót này?
Tài liệu tham khảo
[1] GPT-5 prompting guide – OpenAI Cookbook
🎯 Xem thêm
👉Bí kíp ứng dụng AI trong nghiên cứu khoa học hiệu quả
1. Nhóm Zalo ứng dụng AI trong giáo dục
2. Nhóm Zalo ứng dụng AI trong kinh doanh3. Cộng đồng Facebook Ứng dụng AI trong kinh doanh
4. Cộng đồng Facebook ứng dụng Open AI – ChatGPT trong giáo dục
