Bỏ qua tới nội dung chính
Quay lại tin tức

OpenAI sẽ ngừng cung cấp dịch vụ tinh chỉnh (fine-tuning) vào tháng 1/2027. Dưới đây là những lựa chọn thay thế để đào tạo mô hình.

Dev.to Machine Learning· Moksh Gupta· 5/8/2026opensource

Hãy truy cập và đọc trang thông báo ngừng hỗ trợ của OpenAI. Không phải một bài đăng trên blog về vấn đề này, mà là chính trang đó, được cập nhật ngày 7/5/2026. Nếu tổ chức của bạn chưa từng chạy một tác vụ tinh chỉnh (fine-tuning) nào, bạn sẽ không thể bắt đầu. Kể từ ngày 2/7/2026, các tác vụ mới yêu cầu suy luận (inference) trên một mô hình đã tinh chỉnh trong vòng 60 ngày trước đó. Vào ngày 6/1/2027, cánh cửa này sẽ đóng lại đối với tất cả mọi người, và các mô hình gpt-3.5-turbo, gpt-4, gpt-4.1-nano, babbage-002 và davinci-002 đã tinh chỉnh sẽ ngừng hoạt động vào ngày 23/10/2026. Tôi đã tổng hợp bảng so sánh đầy đủ trên DevToolLab với mọi mức giá được lấy từ trang của nhà cung cấp. Đây là phiên bản rút gọn, vì tiêu đề xứng đáng được...

Hãy đọc trang ngừng cung cấp dịch vụ của OpenAI. Không phải một bài đăng trên blog về nó, mà là chính trang đó, được cập nhật ngày 7/5/2026. Nếu tổ chức của bạn chưa bao giờ chạy một tác vụ tinh chỉnh (fine-tuning), bạn sẽ không thể bắt đầu. Kể từ ngày 2/7/2026, các tác vụ mới yêu cầu suy luận trên một mô hình đã tinh chỉnh trong vòng 60 ngày trước đó. Đến ngày 6/1/2027, cánh cửa đó sẽ đóng lại đối với tất cả mọi người, và các mô hình gpt-3.5-turbo, gpt-4, gpt-4.1-nano, babbage-002 và davinci-002 đã tinh chỉnh sẽ ngừng hoạt động vào ngày 23/10/2026. Tôi đã tổng hợp toàn bộ so sánh trên DevToolLab với mọi mức giá được lấy từ trang của nhà cung cấp. Đây là phiên bản rút gọn, vì tiêu đề xứng đáng được lan truyền: API tinh chỉnh dễ thấy nhất trong ngành đang bị loại bỏ trong khi mọi lựa chọn thay thế đều trở nên rẻ hơn và tốt hơn trong cùng mười hai tháng. Hành vi, không phải sự kiện Trước khi tìm kiếm một nền tảng, hãy đảm bảo bạn cần một nền tảng. Tinh chỉnh thay đổi cách một mô hình hoạt động. Nó không cài đặt kiến thức. "Mô hình chưa bao giờ nghe nói về API thanh toán nội bộ của chúng tôi" là một vấn đề truy xuất. "Mô hình hiểu nhiệm vụ nhưng liên tục trả về văn xuôi khi tôi yêu cầu JSON, hoặc chọn sai nhãn trong số sáu nhãn" là một vấn đề tinh chỉnh, và kỹ thuật nhắc lệnh (prompt engineering) sẽ tiếp tục gần như khắc phục nó mãi mãi. Một bộ lọc quyết định điều đó: bạn có thể ngồi xuống và viết 200 đến 1.000 ví dụ về đầu ra bạn muốn không? Nếu câu trả lời là không, hãy dừng lại ở đây. Không có gì trong danh sách này có thể cứu vãn một tập dữ liệu mà bạn không thể mô tả. Bốn phương pháp, tóm tắt. SFT học từ các cặp đầu vào và đầu ra lý tưởng, và đáp ứng hầu hết các nhu cầu thực tế. DPO học từ các cặp trong đó một câu trả lời tốt hơn câu trả lời khác, phù hợp với công việc theo sở thích như giọng điệu hoặc chất lượng tóm tắt. RFT, trên thực tế là GRPO, học dựa trên một bộ chấm điểm đánh giá các nỗ lực, vì vậy nó phù hợp với các vấn đề bạn có thể đo lường nhưng không thể viết tay, chẳng hạn như mã phải vượt qua một bộ kiểm thử. Distillation sao chép đầu ra của một mô hình lớn vào một mô hình nhỏ hoàn toàn để cắt giảm chi phí phục vụ. Tại sao mọi người đều tìm đến LoRA LoRA đóng băng các trọng số cơ sở và huấn luyện một bộ điều hợp nhỏ bên cạnh chúng. Tỷ lệ là toàn bộ câu chuyện, và bạn có thể tự mình thấy điều đó. Điều này đã chạy trên máy tính xách tay của tôi với peft 0.20.0: from transformers import AutoModelForCausalLM from peft import LoraConfig, get_peft_model base = AutoModelForCausalLM.from_pretrained("HuggingFaceTB/SmolLM2-135M") model = get_peft_model(base, LoraConfig( r=16, lora_alpha=32, task_type="CAUSAL_LM", target_modules=["q_proj", "k_proj", "v_proj", "o_proj"], )) model.print_trainable_parameters() trainable params: 1,843,200 || all params: 136,358,208 || trainable%: 1.3517 Dưới 1,5% trọng số mang quá trình huấn luyện. Ở fp16, bộ điều hợp đó là 3,5 MiB so với mô hình 260 MiB, đó là lý do tại sao một GPU duy nhất có thể phục vụ hàng chục biến thể cụ thể theo tác vụ từ một cơ sở. Các nhà cung cấp đám mây lớn không phải tất cả đều rút lui Hướng dẫn tối ưu hóa mô hình của OpenAI hiện cảnh báo rằng tài liệu tinh chỉnh của họ đang được chuyển sang tài liệu cũ, điều này cho bạn biết điều tương tự như bảng ngừng cung cấp dịch vụ. Những gì vẫn chạy cho khách hàng hiện tại: SFT và DPO trên gpt-4.1, mini và nano, tinh chỉnh thị giác trên gpt-4o-2024-08-06, RFT chỉ trên o4-mini-2025-04-16. Huấn luyện có giá 25 USD cho mỗi triệu token trên gpt-4.1, 5 USD trên mini, 1,50 USD trên nano, và RFT tính phí 100 USD mỗi giờ huấn luyện cốt lõi. Không có mô hình GPT-5 nào từng có thể tinh chỉnh được, và các ghi chú di chuyển hướng bạn đến gpt-5.4-mini và gpt-5.5 chưa được tinh chỉnh. Microsoft đã đi theo hướng khác với cùng một họ mô hình. Foundry chạy RFT trên o4-mini với Global Training trên 13 khu vực với mức giá mỗi token thấp hơn so với tiêu chuẩn, đánh đổi là khả năng lưu trú dữ liệu. GPT-4.1, mini và nano đóng vai trò là người chấm điểm, và lời khuyên của Microsoft là nên chấm điểm bằng nano trước. Nếu cần điều chỉnh mô hình thuộc họ OpenAI được quản lý mà không có lịch trình ngừng hoạt động, đây là lựa chọn nhanh nhất. Google tính phí điều chỉnh Vertex bằng cách nhân số token của tập dữ liệu với số epoch, sau đó tính phí cao hơn mức cơ bản để cung cấp điểm cuối đã điều chỉnh, đây là phần gây bất ngờ cho người dùng khi nhận hóa đơn. Hãy kiểm tra xem ảnh chụp nhanh nào thực sự có thể điều chỉnh được trước khi lên kế hoạch, vì việc điều chỉnh Gemini 3.x đã được triển khai thông qua bản xem trước và danh sách cho phép thay vì tự phục vụ công khai. AWS đã đưa ra một quyết định thú vị nhất bằng cách coi các trọng số mở (open weights) là sự kiện chính. Bedrock đã thêm RFT cho Qwen3-32B và gpt-oss-20b vào ngày 17/2/2026, và mô hình đã điều chỉnh trả lời ngay lập tức thông qua các điểm cuối Responses và Chat Completions tương thích với OpenAI. SageMaker AI tiếp nối vào ngày 25/3/2026 với SFT, DPO và RFT không máy chủ trên mười hai mô hình mở khác bao gồm gpt-oss-120b và Qwen3 14B, tại N. Virginia, Oregon, Tokyo và Ireland. Anthropic là một khoảng trống: không có tinh chỉnh trong API Claude công khai, chỉ có tùy chỉnh Bedrock trên các mô hình Claude mà nó cung cấp. Các chuyên gia cạnh tranh về giá Together AI là con số để so sánh với tất cả các nhà cung cấp khác: 0,48 USD cho mỗi triệu token huấn luyện cho LoRA lên đến 16B, 1,50 USD từ 17B đến 69B, 2,90 USD từ 70B đến 100B, với khả năng tinh chỉnh đầy đủ và DPO cũng có sẵn. Fireworks AI mở cửa với mức giá gần như tương tự là 0,50 USD cho đến 16B nhưng tăng lên 3,00 USD cho 80B và 6,00 USD cho 300B, vì vậy kích thước mô hình mà người dùng thực sự muốn huấn luyện sẽ quyết định cái nào rẻ hơn, chứ không phải logo. Tinker từ Thinking Machines Lab là công cụ mà tôi sẽ sử dụng nếu tôi muốn kiểm soát mà không cần giám sát GPU. Nó tính phí theo triệu token thay vì theo giờ GPU, Qwen3-8B đã tăng từ 0,40 USD lên 0,44 USD vào ngày 17/7/2026, vì vậy một lần chạy 50 triệu token có giá khoảng 22 USD cộng với 0,10 USD cho mỗi GB-tháng của các điểm kiểm tra (checkpoints). Nó chỉ thực hiện LoRA ở rank 32, và nó xuất ra một bộ điều hợp PEFT đơn giản, vì vậy việc rời đi không tốn kém gì. Predibase xứng đáng được cảnh báo hơn là khuyến nghị. GRPO có giá 10 USD cho mỗi triệu token lên đến 16B và 20 USD từ đó đến 32B, với khả năng suy luận không máy chủ miễn phí hào phóng, nhưng nó đã thuộc về Rubrik kể từ tháng 6/2025 và predibase.com không còn phục vụ trang web của riêng mình kể từ tháng 8/2026. Nó chuyển hướng đến Rubrik Agent Cloud. Hãy xác nhận rằng sản phẩm vẫn được bán riêng trước khi xây dựng lộ trình dựa trên nó. Bài đăng gốc có bảng giá đầy đủ của tất cả các sản phẩm này cạnh nhau. Hoặc bỏ qua hoàn toàn hóa đơn Với một GPU, hoặc một giờ thuê một GPU, các công cụ miễn phí là

Nguồn tin: Dev.to Machine Learning — Tác giả: Moksh Gupta. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.