BTC $77,398 +0.27%
ETH $2,537.88 +3.19%
SOL $102.7 +2.78%
BNB $726.9 +1.75%
XRP $1.36 +0.68%
DOGE $0.0845 +0.57%
ADA $0.2067 -0.91%
AVAX $7.48 -1.32%
DOT $1.04 -7.10%
LINK $11.61 +0.28%
⛽ ETH Gas 28 Gwei
Sợ&Tham
56

Giá thị trường

BTC Bitcoin
$77,398 +0.27%
ETH Ethereum
$2,537.88 +3.19%
SOL Solana
$102.7 +2.78%
BNB BNB Chain
$726.9 +1.75%
XRP XRP Ledger
$1.36 +0.68%
DOGE Dogecoin
$0.0845 +0.57%
ADA Cardano
$0.2067 -0.91%
AVAX Avalanche
$7.48 -1.32%
DOT Polkadot
$1.04 -7.10%
LINK Chainlink
$11.61 +0.28%

Lịch sự kiện blockchain

{{年份}}
12
05
halving BCH Halving

Sự kiện giảm một nửa phần thưởng khối

15
04
halving Bitcoin Halving

Phần thưởng khối giảm xuống 3,125 BTC

08
04
upgrade Solana Firedancer

Trình xác thực độc lập ra mắt trên mainnet

18
03
unlock Mở khóa token Sui

Phần đội ngũ và nhà đầu tư sớm được giải phóng

10
05
upgrade Nâng cấp Ethereum Pectra

Tăng giới hạn validator và trừu tượng hóa tài khoản

28
03
unlock Mở khóa token Arbitrum

Giải phóng 92 triệu ARB

22
03
unlock Mở khóa Optimism

Lượng cung lưu hành tăng khoảng 2%

30
04
upgrade Nâng cấp Celestia Mainnet

Cải thiện hiệu quả lấy mẫu tính khả dụng dữ liệu

Theo dõi phí Gas

Ethereum 28 Gwei
BNB Chain 3 Gwei
Polygon 42 Gwei
Arbitrum 0.5 Gwei
Optimism 0.3 Gwei

💡 Smart Money

0xf13a...2e50
Nhà giao dịch on-chain dày dặn
+$0.2M
83%
0x2470...8ef8
Nhà tạo lập thị trường
+$3.9M
81%
0xf7c6...2bfe
Nhà giao dịch on-chain dày dặn
+$3.9M
94%

Công cụ

Tất cả →

MiniMax H3 đang kéo video model xuống làm image model – Chiến lược giấu trong kiến trúc

Lê Yến Thị trường

Trong lúc toàn ngành đang đổ dồn vào cuộc đua video model, một thông tin nhỏ vừa xuất hiện trên Reddit AMA của team MiniMax H3 đã thu hút sự chú ý của tôi. Đội ngũ này xác nhận họ đang phát triển một model tạo ảnh dựa trên chính nền tảng H3 – một video foundation model – và model đó có khả năng chỉnh sửa ảnh zero-shot, dù chưa bao giờ được huấn luyện cho tác vụ này. Nói một cách khác, một hệ thống sinh video bỗng dưng thành thạo chỉnh sửa ảnh, chỉ vì nó đã hiểu thế giới qua những khung hình. Thị trường chưa xôn xao – nhưng với tôi, đó lại là lúc dữ liệu nói nhiều nhất.

MiniMax không phải là một gương mặt mới. Họ sở hữu những sản phẩm C-end như Hailuo AI và Talkie, và H3 là video foundation model thế hệ mới của họ. Theo mô tả từ team, H3 dùng một VAE encoder dùng chung để mã hóa hình ảnh, và giờ họ muốn tiếp tục dùng nó cho một model tạo ảnh. Nhưng khác với cách tiếp cận của nhiều lab khác – vốn tách riêng hoàn toàn image model và video model – MiniMax lại chọn một hướng tái cấu trúc: giữ encoder của H3, thiết kế thêm một VAE decoder riêng cho ảnh tĩnh, sau đó huấn luyện model theo đúng task first-frame-plus-text-to-last-frame.

Đáng chú ý, team tuyên bố model đã ở giai đoạn post-training và có kế hoạch mở mã nguồn trọng số. Điều đó đồng nghĩa với việc họ đã vượt qua giai đoạn xác nhận kiến trúc, và đang trong quá trình tinh chỉnh. Nhưng đây là điểm quan trọng: mô hình này không được mô tả như một image model đứng riêng lẻ, mà là một phần của một pipeline. Team nói rõ rằng họ kỳ vọng image model sẽ tạo ra frame đầu – rồi H3 tiếp tục sinh các frame sau. Nói cách khác, mô hình ảnh này chỉ là một bước đệm cho một quy trình video hoàn chỉnh.

Điểm dữ liệu quan trọng nhất nằm ở việc zero-shot image editing xuất hiện như thế nào. H3 chỉ được huấn luyện với nhiệm vụ dự đoán khung cuối từ khung đầu và văn bản. Nhưng về bản chất toán học, đó chính là một phép chỉnh sửa ảnh có điều kiện: nhận một hình ảnh, một mô tả, và trả về một hình ảnh biến đổi theo đúng mô tả. Khả năng zero-shot không phải là một phép màu. Nó là hệ quả tất yếu của cấu trúc bài toán. Khi một mô hình phải liên tục dự đoán sự thay đổi giữa các khung hình, nó buộc phải nắm được các quy luật biến đổi không gian – và những quy luật đó được áp dụng trực tiếp cho việc chỉnh sửa ảnh tĩnh.

Tôi cũng chú ý đến chi tiết kỹ thuật: VAE encoder dùng chung, nhưng VAE decoder tách riêng. Đây là một quyết định kiến trúc thể hiện rõ sự thận trọng. Video VAE decoder thường được tối ưu cho temporal consistency – tức là sự mượt mà theo thời gian. Điều đó có thể làm giảm độ chi tiết của từng khung hình tĩnh – như kết cấu, độ sắc nét, hoặc chi tiết vi mô. Việc thiết kế một decoder riêng cho ảnh tĩnh chứng tỏ team hiểu rõ sự đánh đổi giữa hai loại dữ liệu. Và tôi tin đó là lý do họ chấp nhận chi phí vận hành thêm một decoder, thay vì dùng chung toàn bộ hệ thống.

Với tư cách một người làm phân tích dữ liệu, tôi muốn nói rõ: một image model học được từ không gian biểu diễn của video có một lợi thế mà các image model truyền thống không có. Stable Diffusion có thể tạo ra những bức ảnh đẹp, nhưng nó không hiểu chuyển động. Còn H3, dù chỉ dùng cho ảnh tĩnh, vẫn mang trong mình logic về thời gian, về trình tự thay đổi, về hậu quả của một hành động. Điều đó có thể giúp ảnh tĩnh của nó có một loại độ sâu mà các model thuần tĩnh khó đạt được. Dĩ nhiên, điều này chỉ có thể xác nhận khi chúng ta có thể tự chạy thử model – và đó là lý do việc mở mã nguồn lại quan trọng đến vậy.

Nhưng đây là lúc tôi muốn dừng lại và đặt một câu hỏi ngược. Nếu image model mở mã nguồn, vậy thương mại hóa nằm ở đâu? Câu trả lời nằm trong một chiến lược kép: mở mã nguồn phần image để thu hút cộng đồng và developer, đồng thời giữ kín phần video model và API. Đây chính là cách mà một số dự án tiền mã hóa đã dùng từ nhiều năm trước: mở mã của lớp cổng vào, nhưng thu phí ở lớp tài chính. Như tôi từng thấy trong các cuộc khảo sát pool thanh khoản giả, hình thức không thể đánh lừa cục diện. Ở đây, cục diện đó là: H3 video API và công cụ tạo video nội dung mới chính là lớp sinh lời thật sự.

Nhưng điểm mù là gì? Đó là việc tất cả thông tin chúng ta có chỉ đến từ lời tự bạch của team trên Reddit AMA. Không có technical paper. Không có benchmark thứ ba. Không có bản dùng thử độc lập. Trong lịch sử dữ liệu của tôi, những mô hình từng tuyên bố zero-shot mạnh mẽ nhất lại là những mô hình không bao giờ được đưa ra kiểm chứng công khai trước khi phát hành. Sự thận trọng, trong trường hợp này, không phải là hoài nghi – mà chỉ là một cách đọc dữ liệu.

Nếu những chia sẻ trên Reddit AMA là chính xác, chúng ta sẽ chứng kiến một bước dịch chuyển ranh giới: không còn nói về image model riêng và video model riêng. Cái gọi là image model chỉ là một chiều không gian của một hệ thống biểu diễn lớn hơn. Điều này có ý nghĩa lớn với các nhà phát triển đang xây dựng công cụ tổng hợp hình ảnh cho blockchain, NFT, hoặc game – khi một pipeline video thống nhất trở thành một thực tế. Nhưng câu hỏi còn bỏ ngỏ vẫn nằm ở đó: liệu chúng ta đang nhìn vào một kiến trúc mới, hay chỉ đang nhìn vào một lời hứa được đánh bóng bằng kỹ thuật?

Sợ & Tham

56

Tham lam

Tâm lý thị trường

Chỉ số mùa altcoin

42

Mùa Bitcoin

Sự thống trị BTC Mùa altcoin

Vốn hóa thị trường

Tất cả →
# Tiền điện tử Giá
1
Bitcoin BTC
$77,398
1
Ethereum ETH
$2,537.88
1
Solana SOL
$102.7
1
BNB Chain BNB
$726.9
1
XRP Ledger XRP
$1.36
1
Dogecoin DOGE
$0.0845
1
Cardano ADA
$0.2067
1
Avalanche AVAX
$7.48
1
Polkadot DOT
$1.04
1
Chainlink LINK
$11.61

🐋 Theo dõi cá voi

🟢
0xb821...ceab
12 phút trước
Chuyển vào
882,926 USDT
🔵
0x450f...a646
30 phút trước
Stake
50,318 BNB
🟢
0xa166...284a
2 phút trước
Chuyển vào
2,947,256 USDC