Trong cộng đồng AI mã nguồn mở, ai cũng nhận thấy khoảng cách giữa họ và các “ông lớn” công nghệ không chỉ đơn thuần là sức mạnh tính toán. Ai2 đang nỗ lực thu hẹp khoảng cách này, bằng cách cung cấp cơ sở dữ liệu và mô hình mã nguồn mở và gần đây nhất là Tülu 3 – một quy trình hậu huấn luyện mở, dễ điều chỉnh, giúp chuyển đổi các mô hình ngôn ngữ lớn (LLM) từ dạng “thô” sang dạng ứng dụng thực tiễn.
Khác với quan niệm phổ biến, các mô hình ngôn ngữ “nền tảng” sau khi được huấn luyện xong chưa sẵn sàng để triển khai. Tiền huấn luyện là bước cần thiết, nhưng chưa đủ. Thậm chí, nhiều chuyên gia tin rằng tiền huấn luyện có thể sớm không còn là yếu tố quan trọng nhất.
Giá trị thực sự được tạo ra ở giai đoạn hậu huấn luyện. Đây là giai đoạn “nhào nặn” mô hình từ một mạng lưới khổng lồ, chứa đựng lượng kiến thức đồ sộ, nhưng chưa được tinh chỉnh, có thể tạo ra cả nội dung tiêu cực lẫn tích cực.
Các công ty lớn thường giữ bí mật về quy trình hậu huấn luyện của họ. Lý do là, mặc dù ai cũng có thể thu thập dữ liệu web và xây dựng mô hình bằng các phương pháp tiên tiến, nhưng việc tinh chỉnh mô hình để phục vụ cho các mục đích cụ thể, ví dụ như hỗ trợ trị liệu tâm lý hay phân tích nghiên cứu, lại là một thách thức hoàn toàn khác biệt.
Ai2 (trước đây là Viện AI Allen) đã lên tiếng về sự thiếu minh bạch trong các dự án AI “mở” như Llama của Meta. Mặc dù mô hình này miễn phí sử dụng và điều chỉnh, nhưng nguồn dữ liệu, quy trình tạo ra mô hình thô và phương pháp huấn luyện để sử dụng chung vẫn được giữ kín. Điều này không hẳn là xấu, nhưng cũng không thực sự “mở”.
Ngược lại, Ai2 cam kết tối đa hóa tính minh bạch, từ việc công khai dữ liệu, quy trình thu thập, quản lý, làm sạch dữ liệu, đến phương pháp huấn luyện được sử dụng để tạo ra các LLM như OLMo.
Tuy nhiên, thực tế là rất ít nhà phát triển có đủ năng lực để tự vận hành LLM, và càng ít người có thể thực hiện hậu huấn luyện như Meta, OpenAI hay Anthropic. Nguyên nhân một phần là do thiếu kiến thức chuyên môn, một phần do quy trình này phức tạp và tốn thời gian.
Với mong muốn dân chủ hóa khía cạnh này của hệ sinh thái AI, Ai2 đã phát triển Tülu 3. Đây là phiên bản cải tiến vượt bậc so với quy trình hậu huấn luyện trước đó (Tülu 2). Kết quả thử nghiệm cho thấy Tülu 3 đạt hiệu suất tương đương với các mô hình “mở” tiên tiến nhất hiện nay. Để đạt được điều này, Ai2 đã dành nhiều tháng nghiên cứu, thử nghiệm, phân tích các thông tin được hé lộ từ các công ty lớn, và thực hiện nhiều lần huấn luyện lặp đi lặp lại.
Tülu 3 bao gồm toàn bộ quy trình, từ việc lựa chọn trọng tâm cho mô hình (ví dụ: giảm khả năng đa ngôn ngữ, tăng cường toán học và lập trình), đến việc áp dụng các kỹ thuật quản lý dữ liệu, học tăng cường, tinh chỉnh, điều chỉnh siêu tham số và quy trình huấn luyện. Mục tiêu là tạo ra một mô hình hiệu quả, tập trung vào các kỹ năng cần thiết.
Ý nghĩa quan trọng của Tülu 3 là giúp cộng đồng AI mã nguồn mở giảm sự phụ thuộc vào các công ty tư nhân. Trước đây, việc xây dựng LLM tùy chỉnh thường phải sử dụng tài nguyên của các công ty lớn hoặc thuê dịch vụ từ bên thứ ba, dẫn đến chi phí cao và rủi ro bảo mật.
Ví dụ, với các công ty nghiên cứu và dịch vụ y tế, việc sử dụng API của OpenAI hoặc hợp tác với Scale để tùy chỉnh mô hình nội bộ đều tiềm ẩn rủi ro liên quan đến dữ liệu người dùng nhạy cảm. Tülu 3, cùng với các mô hình mã nguồn mở như OLMo, mang đến giải pháp thay thế hiệu quả, cho phép triển khai và kiểm soát toàn bộ quy trình huấn luyện ngay tại chỗ.
Bản thân Ai2 cũng đang sử dụng Tülu 3, đây là minh chứng rõ ràng nhất cho hiệu quả của công cụ này. Mặc dù các kết quả thử nghiệm hiện tại sử dụng Llama làm mô hình nền tảng, Ai2 dự kiến sẽ sớm ra mắt mô hình dựa trên OLMo và được huấn luyện bởi Tülu 3, hứa hẹn mang đến những cải tiến vượt trội hơn nữa, đồng thời hoàn toàn là mã nguồn mở.
Tin tài trợ
-
Tài trợMobile
Rò rỉ Galaxy S25 Ultra: Thiết kế cạnh viền bo tròn giống iPhone
Samsung Galaxy S24 Ultra sở hữu vẻ ngoài rất đặc biệt với các góc vuông và cạnh bo tròn, nhưng những rò rỉ cho thấy thế hệ tiếp theo có thể sẽ có thiết kế tiêu chuẩn hơn. Hình ảnh được cho là của Galaxy S25 Ultra hoặc có thể là “Galaxy S25 Note” hiện […] -
Tài trợAI
Edifier X3 Pro: Tai nghe giá tốt, ANC và kháng khuẩn
Mới đây, Edifier đã chính thức ra mắt mẫu tai nghe TWS mới nhất của hãng – Edifier X3 Pro tại thị trường Trung Quốc, với mức giá chỉ 149 NDT (khoảng 530.000 VNĐ). Ở một mức giá phải chăng, tai nghe này lại sở hữu những tính năng hiện đại không thua kém các […]
Bài viết liên quan
Edifier X3 Pro: Tai nghe giá tốt, ANC và kháng khuẩn
Suno v4 cải tiến giọng hát AI, mở rộng sáng tạo âm nhạc
ChatGPT-4o: Nhanh hơn, sâu hơn, sáng tạo hơn
LLMs sẽ nâng cấp Siri lên một tầm cao mới
Tülu 3: Ai2 mở ra trò chơi AI mới cho mọi người
YouTube nâng tầm Shorts với AI
Giáo sư Stanford bị tố dùng AI viết lời khai trong vụ kiện Deepfake
Robot đang xâm chiếm ngành dịch vụ Las Vegas?
Samsung ra mắt Gauss2: AI mạnh mẽ hơn
Mua sắm dễ dàng hơn với Google Lens
Coca-Cola bị chê bai vì quảng cáo Giáng sinh bằng AI
Lighthouse nhận được 370 triệu USD đầu tư, trở thành “ngôi sao sáng” trong lĩnh vực phân tích dữ liệu cho ngành khách sạn
Tin vui cho cộng đồng yêu sách: Microsoft và HarperCollins hợp tác để tạo ra những trợ lý ảo thông minh hơn
16 triệu USD đổ vào OneCell Diagnostics để phát triển AI chống ung thư tái phát
Dữ liệu y tế và AI: Rủi ro bảo mật cần cân nhắc
AI mới trong Microsoft 365: Tự động hóa công việc hiệu quả
Microsoft kết hợp với Meta, đưa Windows 11 vào thực tế ảo
Siri tích hợp ChatGPT: Bước tiến mới của Apple
5 bí quyết sử dụng ChatGPT hiệu quả từ người sáng lập OpenAI
ĐĂNG KÝ NHẬN TIN
NGAY HÔM NAY
Đăng ký để nhận thông tin sớm nhất về những câu chuyện nóng hổi hiện nay trên thị trường, công nghệ được cung cấp hàng ngày.
Bằng cách nhấp vào “Đăng ký”, bạn chấp nhận Điều khoản dịch vụ và Chính sách quyền riêng tư của chúng tôi. Bạn có thể chọn không tham gia bất cứ lúc nào.
5
s
Nhận xét (0)