Bỏ qua tới nội dung chính
Quay lại tin tức

[AINews] Hôm nay không có nhiều sự kiện đáng chú ý.

Latent Space· Latent.Space· 3/10/2026models

Nếu quý vị đang đọc thông tin này, có lẽ quý vị nên tận hưởng kỳ nghỉ cuối tuần của mình. Tin tức AI ngày 01/10/2026 – 02/10/2026. Chúng tôi đã kiểm tra 12 diễn đàn Reddit, 544 tài khoản Twitter và không có thêm kênh Discord nào. Trang web của AINews cho phép quý vị tìm kiếm tất cả các số báo trước đây. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Quý vị có thể tùy chỉnh tần suất nhận email. Tổng hợp tin tức AI từ Twitter GPT-6.1 Sol và Sonnet 5.5 định hình lại ranh giới chi phí – hiệu suất Ra mắt GPT-6.1 Sol: OpenAI định giá Sol ở mức 2 USD/10 USD cho mỗi triệu token đầu vào/đầu ra, so với mức 10 USD/50 USD của Astra (tóm tắt giá). Kết quả công bố: Theo báo cáo, phiên bản này vượt trội hơn GPT-6 Sol.

Nếu quý vị đang đọc tin này, có lẽ quý vị nên tận hưởng kỳ nghỉ cuối tuần của mình. Tin tức AI ngày 01/10/2026 – 02/10/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có Discord nào khác. Trang web của AINews cho phép quý vị tìm kiếm tất cả các số báo trước đây. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Quý vị có thể tùy chỉnh tần suất nhận email. Tổng hợp tin tức AI trên Twitter GPT-6.1 Sol và Sonnet 5.5 định hình lại ranh giới chi phí – hiệu suất Ra mắt GPT-6.1 Sol: OpenAI định giá Sol ở mức 2 USD/10 USD cho mỗi triệu token đầu vào/đầu ra, so với 10 USD/50 USD của Astra (tóm tắt giá). Kết quả được công bố: Theo báo cáo, mô hình này vượt trội hơn GPT-6 Sol 6,4 điểm trên DeepSWE v1.1 và hơn Opus 5.5 2,2 điểm trên AutomationBench (tóm tắt). Định vị: Nhân viên OpenAI mô tả Sol là "tốt, rẻ VÀ nhanh" (@reach_vb). Sử dụng Codex: Việc đặt lại toàn cầu mức sử dụng Codex đã được ấn định vào 10 giờ sáng (giờ PT) ngày 02/10 (@reach_vb). Sử dụng công cụ: Sol được cho là "THỰC SỰ yêu thích chế độ mã hóa (codemode)", phù hợp với việc các mô hình GPT được đào tạo trên chế độ này (@badlogicgames, ghi chú về codemode). Xếp hạng Agent Arena: Sol [Max] ra mắt ở vị trí thứ 5 (+11,23%) với chi phí trung bình 0,56 USD cho mỗi tác vụ (@arena). So sánh chi phí của Sol: Mức này rẻ hơn 39% so với GPT-6 Sol trong khi đạt điểm cao hơn 1,52 điểm. Nó rẻ hơn 81% so với Astra trong khi chỉ kém 1,04 điểm. Sonnet 5.5: Sonnet 5.5 [Max] ra mắt ở vị trí thứ 3 (+12,5%) và xếp hạng số 1 trong hạng mục Chat. Chi phí của nó là 2,74 USD cho mỗi tác vụ, so với 1,58 USD của Opus 5.5 xếp thứ 2, điều này khiến nó không nằm trên đường Pareto (ra mắt, đường Pareto). Vị trí của Anthropic: Các mô hình của Anthropic hiện giữ ba vị trí hàng đầu trong Agent Arena. Code and Text Arena: Sol đã nhanh chóng lọt vào WebDev ở vị trí thứ 3 trước khi Sonnet 5.5 đẩy nó xuống vị trí thứ 4 (tổng kết hàng tuần). Sonnet trên WebDev: Sonnet hiện kém GPT-6 Astra [Max] 2 điểm với chi phí thấp hơn 80%. Gemini 4 Argon: Argon [High] giành vị trí số 1 trong Text Arena. Các mô hình mã nguồn mở: MiMo-V2.6-Pro và Flash đã tham gia Agent Arena ở vị trí thứ 5 và thứ 9 trong số các mô hình mã nguồn mở. Các đánh giá độc lập khác: WeirdML v3 nhận thấy Sol rất hiệu quả về token, gần với Astra nhưng có hiệu suất đỉnh thấp hơn. Trên cùng một tiêu chuẩn, Sonnet 5.5 vượt trội hơn Opus 5 và Grok 4.7 vượt trội hơn Kimi-K3; những kết quả này chưa hoàn chỉnh (@htihle). Phong cách lập luận: Design Arena đã đọc 324 bản tóm tắt tư duy. Nó phát hiện ra rằng Astra thường đưa ra các lập luận phòng ngừa gấp khoảng 20 lần so với Opus 5.5, trong khi Opus cam kết sớm trong khoảng 4 trên 5 bản tóm tắt (@DesignArena). Xem trước Step 5: Mô hình của StepFun xếp thứ 7 trong số các mô hình mã nguồn mở trên Vals với chi phí 2,54 USD cho mỗi tác vụ. Nó mất trung bình gần hai giờ cho mỗi tác vụ và có cửa sổ ngữ cảnh 1 triệu token (Vals, chi tiết). Tin đồn (chưa được xác nhận): Fable 5.5: Claude Fable 5.5 được đồn đại sẽ ra mắt vào tuần tới và được cho là vượt trội hơn một "Astra 6.1" mà theo báo cáo đã bị trì hoãn do lo ngại về bảo mật. Người đăng tin cho biết anh ta không thể xác minh cả hai tuyên bố (@kimmonismus, theo dõi). GPT-6 Astra Lite: Một danh sách "GPT-6 Astra Lite" đã được phát hiện, mà @scaling01 suy đoán là cùng một mô hình với Sol (@scaling01). Các mô hình quyết định và mã nguồn mở: llama.cpp đã thêm một điểm cuối /v1/systemone để suy luận mô hình quyết định "kiểu Jev" cục bộ (@ggerganov). Chạy cục bộ: Các mô hình được khởi chạy bằng llama serve -hf ggml-org/Kev-4B-GGUF (@ClementDelangue). Jared Palmer đã xuất bản một bài viết về cách Kev 1.0 hoạt động (bài viết). Hệ sinh thái: Perplexity tuyên bố pplx-decider-v1-27b đạt trung bình 85,7% trên 11 tiêu chuẩn, vượt trội hơn Jev (@AravSrinivas). Các mô hình quyết định Clef hiện đã có trên Ollama (@lucataco). Quan điểm hoài nghi: @mervenoyann gọi các mô hình quyết định là một cách đổi tên của các bộ phân loại không cần ví dụ (zero-shot classifiers) (tweet). Phân tích hiệu chuẩn: Một bài đăng trên blog liên kết hiệu chuẩn kiểu Jev với giá trị và dự đoán hàm Q (@SOURADIPCHAKR18). webAI TwIL-LM3-Pro: Mô hình 3,66B này được huấn luyện hậu kỳ từ Granite 4.2. Trong các thử nghiệm của webAI, nó gần như sánh ngang với Qwen3-8B về logic hình thức. Phiên bản Q4 GGUF có dung lượng 2,09 GiB và giấy phép là phi thương mại (@kimmonismus). Reka RIDM: Reka đã phát hành một mô hình động lực học nghịch đảo theo giấy phép Apache 2.0. Mô hình này được huấn luyện trên các trò chơi, có khả năng tổng quát hóa sang video thực và trích xuất các hành động của động cơ và camera (@RekaAILabs). Các công cụ điều phối tác nhân, trợ lý và công cụ phát triển OpenAI dots: Sam Altman gọi dot là sản phẩm yêu thích của OpenAI, cho rằng nó cải thiện hàng ngày khi học hỏi quy trình làm việc của ông (@sama). Khả năng: Dot duy trì ngữ cảnh trên các ứng dụng, điều phối các tác vụ Codex và gắn cờ các mục cần chú ý (@OpenAIDevs). So sánh: Một người dùng thích thiết lập "trưởng phòng" đa tác nhân của Grokbot (@kimmonismus). Một bản sao tự làm sử dụng Pi, cổng Telegram và bất kỳ mô hình nào (@_alejandroao). Muse Gadgets: Meta đã mở mã nguồn firmware ESP32 và SDK Linux để xây dựng phần cứng hoạt động với Muse (@natfriedman). Muse Home Link: Meta đã sản xuất 5.000 thiết bị cầu nối nhà thông minh của riêng mình, miễn phí cho người đăng ký cho đến khi hết hàng (@alexandr_wang, vận chuyển). Các công cụ điều phối mở rộng: DeepSeek Harness đã phát hành các bản dựng dành cho máy tính để bàn cho macOS và Windows; người dùng Linux cài đặt @deepseek-ai/dsh từ npm (@deepseek_ai). Các bản sửa đổi mã Claude: Các bản sửa đổi là các plugin với các hook kiểu middleware vào Claude Code (@lydiahallie). Plugin "Bạn nên biết" mới tạo ra một tác nhân phụ để gắn cờ các đầu ra quan trọng mà người dùng có thể bỏ lỡ (@ClaudeDevs). Pi Durable: Pi hiện chạy trên Cloudflare Durable Objects thông qua SDK tác nhân v0.26.0, cùng với bản phát hành v1.0 của Pi (@mattzcarey, @badlogicgames). Ngữ cảnh: @omarsar0 coi các bản phát hành này là một sự chuyển dịch sang các công cụ điều phối dễ uốn nắn (chuỗi). Viết lại công cụ điều phối mã T3: Dự án đã vượt qua 400.000 người dùng (@theo). Yêu cầu kéo dài 4 tháng của nó, với 823 cam kết trên 1.912 tệp, hiện đã được hợp nhất (@maria_rcks). Các tính năng mới: Bản viết lại bổ sung hỗ trợ Pi, delegate_task đa nhà cung cấp, một ACP registry, phân nhánh luồng, chuyển đổi mô hình giữa luồng, chế độ xem dòng dõi tác nhân phụ và các tác vụ theo lịch trình (danh sách tính năng). Cập nhật nền tảng: API Agents của OpenAI đã bổ sung tính năng sử dụng máy tính trình duyệt một lần gọi, Bedrock Managed Agents và môi trường di động. Nó cũng tuyên bố độ tin cậy lượt 99,97% và các cuộc gọi công cụ nhanh hơn 20% (@stevendcoffey). Cursor Rollouts: Khi Rollouts phát hiện một lỗi hồi quy, nó sẽ tìm PR gây lỗi, mở một vấn đề và cung cấp giải pháp sửa lỗi tác nhân đám mây chỉ bằng một cú nhấp chuột (@cu

Nguồn tin: Latent Space — Tác giả: Latent.Space. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.