Asana đã triển khai các thay đổi cho tác nhân duyệt web trong StackAI sau một nghiên cứu gồm 144 lượt chạy, theo nghiên cứu tình huống OpenAI công bố ngày 9/10/2026. Cấu hình tối ưu dùng GPT-6.1 Sol đạt chi phí mô hình ước tính trung bình 0,47 USD và thời gian khoảng bốn phút mỗi lượt, được báo cáo là rẻ hơn 76 lần và nhanh hơn năm lần so với cấu hình sản xuất ban đầu dùng một mô hình khác.
Điểm đáng chú ý nằm ở cách quản lý lịch sử: lưu thêm thông tin và giảm tần suất chỉnh sửa ảnh chụp màn hình giúp tác nhân tận dụng cache, đồng thời tránh phải quay lại những trang đã đọc. Tuy nhiên, mức cải thiện 76 lần kết hợp cả thay đổi quy trình lẫn lựa chọn mô hình, không phải hiệu quả riêng của cache.
Lịch sử duyệt web trở thành điểm nghẽn chi phí
StackAI, nền tảng được Asana mua lại, cho phép người dùng xây dựng quy trình điều hướng website, điền biểu mẫu và thu thập thông tin mà không cần viết mã. Với tác nhân kiểu này, mỗi bước có thể bổ sung văn bản trang và ảnh chụp màn hình vào ngữ cảnh gửi cho mô hình.
Theo OpenAI, Frank Hidalgo, CTO của StackAI tại Asana, dùng GPT-6 Astra trong Codex để khảo sát mã nguồn và cách tác nhân tạo từng yêu cầu. Hệ thống đã cache phần hướng dẫn cố định và định nghĩa công cụ, nhưng chưa cache lịch sử duyệt web đang tăng dần. Vì vậy, lịch sử được gửi lại với giá đầu vào không cache.
Một vấn đề khác khiến việc bổ sung cache đơn thuần chưa đủ: tác nhân xóa ảnh cũ và cắt bớt văn bản gần như ở mỗi bước. Các thao tác này liên tục thay đổi lịch sử. Chúng cũng có thể làm mất dữ kiện cần thiết, buộc tác nhân truy cập lại trang đã đọc.
Về cơ chế, cache đầu vào có lợi khi những phần nội dung lặp lại được tái sử dụng. Giữ lịch sử ổn định lâu hơn tạo điều kiện cho việc đó; liên tục cắt sửa lịch sử có thể làm giảm lợi ích dù tổng ngữ cảnh ngắn hơn.
Thay đổi được kiểm tra qua 144 lượt chạy
Hidalgo chọn ba hướng để thử nghiệm: mở rộng cache sang lịch sử duyệt web, tăng lượng văn bản được giữ lại và xóa ảnh chụp theo đợt thay vì ở từng bước.
GPT-6 Astra sau đó tái cấu trúc mã để cùng một frontend và backend hỗ trợ nhiều quy trình có cấu hình riêng chạy song song. Nghiên cứu so sánh hai ngân sách lịch sử, 120.000 và 480.000 ký tự, cùng sáu chính sách cache và ảnh chụp. Mỗi tổ hợp được chạy ba lần trên từng mô hình trong bốn mô hình, tạo thành 144 lượt.
Tất cả cấu hình thực hiện cùng một nhiệm vụ: thu thập sáu trường thông tin cho mỗi cuốn trong 32 cuốn sách từ một danh mục demo công khai. Đây là phạm vi cụ thể, không phải tập kiểm thử bao quát mọi website hay nghiệp vụ.
Chính sách được chọn cho phép ảnh chụp tích lũy tới 20 ảnh rồi mới giữ lại ảnh gần nhất. Kết hợp với ngân sách văn bản lớn hơn, cách này giữ phần lịch sử trước đó không đổi trong nhiều bước liên tiếp.
Các yêu cầu, dấu vết dữ liệu và kết quả được ghi trong Command, nền tảng phân phối phần mềm của Asana. Theo nguồn, kết quả được chuyển thành ticket, pull request rồi đưa vào sản xuất. Cách lưu dấu vết này cũng liên quan đến yêu cầu tái hiện lỗi trong kiểm thử sản phẩm bằng tác nhân AI: đầu ra cuối cùng chưa đủ để giải thích một lượt chạy thất bại.
Cần tách mức giảm 76 lần khỏi hiệu quả trên cùng mô hình
Con số nổi bật nhất so sánh cấu hình ban đầu trên Model B với cấu hình tối ưu trên GPT-6.1 Sol. Model B được ẩn danh trong bài công bố, nên không có cơ sở xác định nhà cung cấp hoặc sản phẩm cụ thể.
Với riêng Model B, chi phí mô hình ước tính giảm từ ít nhất 36,21 USD xuống 1,24 USD mỗi lượt, tương đương khoảng 29 lần. Mốc ban đầu là cận dưới vì một số lượt chạm giới hạn số bước trước khi hoàn thành.
Trên GPT-6.1 Sol, khi giữ ngân sách lịch sử lớn hơn, chính sách cache và ảnh chụp mới giảm chi phí từ 1,97 USD xuống 0,47 USD, khoảng bốn lần. Nguồn cho biết 89% đầu vào đến từ cache, với đơn giá bằng 5% đầu vào không cache trong phép đo này.
Do đó, mức giảm 76 lần không nên được diễn giải thành một thao tác bật cache sẽ mang lại kết quả tương tự. Nó phản ánh tổng hợp nhiều thay đổi, đồng thời dùng một cấu hình ban đầu có các lượt chưa hoàn thành. Các khoản tiền được báo cáo cũng là chi phí mô hình ước tính, không phải toàn bộ chi phí vận hành trình duyệt, hạ tầng và nhân sự.
Giữ ngữ cảnh ảnh hưởng cả khả năng hoàn thành
Chi phí không phải kết quả duy nhất. Với GPT-6.1 Sol, tăng ngân sách lịch sử từ mức nhỏ lên mức lớn giúp số lượt tạo được câu trả lời tăng từ ba trên 18 lên toàn bộ 18 lượt; các câu trả lời ở nhóm lớn hơn đều đúng theo nhiệm vụ thử nghiệm.
Kết quả cho thấy giảm ngữ cảnh không mặc nhiên là tiết kiệm. Nếu tác nhân mất thông tin rồi phải đọc lại trang, hoặc không hoàn tất công việc, chi phí mỗi yêu cầu thấp hơn chưa chắc tạo ra chi phí thấp hơn cho một tác vụ thành công.
Đây cũng là lý do cần phân biệt năng lực mô hình với môi trường chạy, như trong bài đánh giá GPT-6 Astra trước khi triển khai. Trong nghiên cứu Asana, Astra hỗ trợ khảo sát và thực hiện thí nghiệm; Sol là mô hình chạy cấu hình trình duyệt đạt kết quả được nêu.
Đã triển khai, nhưng phạm vi khái quát còn hạn chế
Asana cho biết đã phát hành thay đổi điều hướng trình duyệt trong StackAI và đang phát triển công cụ để lặp lại các thí nghiệm dễ hơn. Công ty dự định đưa việc so sánh chi phí, thời gian chạy và chất lượng câu trả lời vào hệ thống đánh giá của nền tảng.
Các kết quả hiện được trình bày trong nghiên cứu tình huống do OpenAI xuất bản, không phải kiểm định độc lập. Mỗi cấu hình có ba lượt lặp và cùng xử lý một nhiệm vụ thu thập dữ liệu. Chúng chưa xác lập mức tiết kiệm cho website có đăng nhập, giao diện biến động hoặc quy trình có hành động ghi dữ liệu.
Việc đưa tác nhân từ thử nghiệm sang vận hành vì thế vẫn gắn với bài toán quản trị ứng dụng AI nội bộ. Nghiên cứu lần này cung cấp bằng chứng cụ thể về tối ưu ngữ cảnh và cache, nhưng không chứng minh khả năng kiểm soát quyền truy cập hay độ an toàn cho mọi tác vụ trình duyệt.
Câu hỏi thường gặp
Ngân sách 480.000 ký tự có tương đương 480.000 token không?
Không. Ký tự và token là hai đơn vị khác nhau; số token phụ thuộc nội dung và bộ mã hóa của mô hình. Nghiên cứu mô tả ngân sách lịch sử bằng ký tự, nên không thể chuyển trực tiếp thành giới hạn token hoặc cửa sổ ngữ cảnh.
Có thể dùng ngay chính sách giữ 20 ảnh chụp cho mọi tác nhân không?
Đây là cấu hình được chọn trong nhiệm vụ thử nghiệm của Asana, không phải ngưỡng tối ưu phổ quát. Tác vụ phụ thuộc nhiều vào thông tin thị giác hoặc có số bước khác nhau cần được đánh giá riêng về chất lượng, thời gian và chi phí.
