Một kỹ thuật mới mang tên “underdrawing” (vẽ nền) đang giúp các mô hình AI tạo ảnh như Google Gemini 3.0 Pro vượt qua điểm yếu cố hữu: chữ và số trong hình ảnh. Trước đây, ngay cả những mô hình tốt nhất cũng thường tạo ra số sai thứ tự, chữ méo mó hoặc lỗi logic. Với underdrawing, quy trình gồm hai lớp: đầu tiên, một bản phác thảo chính xác (SVG, Python) đặt đúng vị trí các chữ/số; sau đó, mô hình AI "tô màu" lên trên để biến nó thành ảnh chân thực.

“Bí kíp” đơn giản mà hiệu quả

Nhà phát triển Sam Collins đã thử nghiệm thành công với bảng trò chơi xoắn ốc 50 ô, mỗi ô đánh số từ 1 đến 50. Kết quả từ Gemini 3.0 Pro cho ra số liền mạch, đúng trình tự – điều mà ChatGPT-Images-2 không làm được. Ý tưởng này nảy sinh khi Collins làm bảng trò chơi phiêu lưu 100 bước cho con: thay vì để AI “đoán” mọi thứ, hãy cung cấp khung sườn và chỉ yêu cầu nó “vẽ đè” lên.

Vì sao điều này quan trọng?

Với người dùng thông thường, việc tạo ảnh quảng cáo, biểu đồ, hay bảng chỉ dẫn có chữ không lỗi là bước đột phá. Doanh nghiệp có thể tận dụng kỹ thuật này để tạo tài liệu đào tạo, mockup sản phẩm, hoặc nội dung AI mà không sợ sai sót. Đây cũng là minh chứng cho thấy Google đang dẫn đầu trong việc kết hợp ngôn ngữ và hình ảnh, mở đường cho các ứng dụng thực tế từ công nghệ generative.