
Văn bản thành hình ảnh
Tạo hình ảnh AI từ prompt văn bản
Dùng thử API MiniMax H3 cho chuyển nội dung tham chiếu thành video với tối đa chín hình ảnh, ba video và ba nội dung âm thanh tham chiếu, cùng đầu ra 2K và thời lượng linh hoạt 5–15 giây.
// Step 1: Submit generation request with image, video, and audio references
const response = await fetch('https://api.flaq.ai/api/v1/video/task', {
method: 'POST',
headers: {
'Content-Type': 'application/json',
'Authorization': 'Bearer YOUR_API_KEY'
},
body: JSON.stringify({
model_name: 'minimax-h3-reference-to-video',
prompt: 'Use image one for the subject, video one for the movement, and audio one for the atmosphere',
resolution: '2k',
duration: 8,
aspect_ratio: '16:9',
images: ['https://example.com/subject-reference.jpg'],
videos: ['https://example.com/motion-reference.mp4'],
audios: ['https://example.com/atmosphere-reference.mp3']
})
});
const { data } = await response.json();
const taskId = data.task_id;
// Use the @ (AT) reference feature in prompt through <<<...>>> placeholders.
// Placeholder numbering is 1-based for each media array:
// <<<image_1>>> = images[0], <<<image_2>>> = images[1]
// <<<video_1>>> = videos[0], <<<audio_1>>> = audios[0]
const mediaReferenceResponse = await fetch('https://api.flaq.ai/api/v1/video/task', {
method: 'POST',
headers: {
'Content-Type': 'application/json',
'Authorization': 'Bearer YOUR_API_KEY'
},
body: JSON.stringify({
model_name: 'minimax-h3-reference-to-video',
prompt: 'Place the explorer from <<<image_1>>> in the environment from <<<image_2>>>, following the camera movement in <<<video_1>>> and speaking with the reference voice from <<<audio_1>>>',
resolution: '2k',
duration: 10,
aspect_ratio: '16:9',
images: [
'https://example.com/explorer-reference.jpg',
'https://example.com/environment-reference.jpg'
],
videos: ['https://example.com/camera-movement-reference.mp4'],
audios: ['https://example.com/voice-reference.mp3']
})
});
const { data: mediaReferenceData } = await mediaReferenceResponse.json();
const mediaReferenceTaskId = mediaReferenceData.task_id;
// Step 2: Poll for results
const taskId = data.task_id;
const pollResult = async (taskId) => {
const res = await fetch(`https://api.flaq.ai/api/v1/video/${taskId}`, {
headers: { 'Authorization': 'Bearer YOUR_API_KEY' }
});
return res.json();
};
while (true) {
const pollResultData = await pollResult(taskId);
const status = pollResultData.data.task_status;
if (status === 'succeed') {
console.log(pollResultData.data.task_result.videos[0].url);
break;
}
if (status === 'failed') {
console.error(pollResultData.data.task_status_msg);
break;
}
await new Promise(resolve => setTimeout(resolve, 10000));
}
# Step 1: Submit generation request with image, video, and audio references
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/video/task',
headers={
'Content-Type': 'application/json',
'Authorization': 'Bearer YOUR_API_KEY'
},
json={
'model_name': 'minimax-h3-reference-to-video',
'prompt': 'Use image one for the subject, video one for the movement, and audio one for the atmosphere',
'resolution': '2k',
'duration': 8,
'aspect_ratio': '16:9',
'images': ['https://example.com/subject-reference.jpg'],
'videos': ['https://example.com/motion-reference.mp4'],
'audios': ['https://example.com/atmosphere-reference.mp3']
}
)
result = response.json()
task_id = result['data']['task_id']
# Use the @ (AT) reference feature in prompt through <<<...>>> placeholders.
# Placeholder numbering is 1-based for each media array:
# <<<image_1>>> = images[0], <<<image_2>>> = images[1]
# <<<video_1>>> = videos[0], <<<audio_1>>> = audios[0]
media_reference_response = requests.post(
'https://api.flaq.ai/api/v1/video/task',
headers={
'Content-Type': 'application/json',
'Authorization': 'Bearer YOUR_API_KEY'
},
json={
'model_name': 'minimax-h3-reference-to-video',
'prompt': 'Place the explorer from <<<image_1>>> in the environment from <<<image_2>>>, following the camera movement in <<<video_1>>> and speaking with the reference voice from <<<audio_1>>>',
'resolution': '2k',
'duration': 10,
'aspect_ratio': '16:9',
'images': [
'https://example.com/explorer-reference.jpg',
'https://example.com/environment-reference.jpg'
],
'videos': ['https://example.com/camera-movement-reference.mp4'],
'audios': ['https://example.com/voice-reference.mp3']
}
)
media_reference_result = media_reference_response.json()
media_reference_task_id = media_reference_result['data']['task_id']
# Step 2: Poll for results
task_id = response.json()['data']['task_id']
poll_url = f"https://api.flaq.ai/api/v1/video/{task_id}"
while True:
poll_result = requests.get(poll_url, headers={'Authorization': 'Bearer YOUR_API_KEY'}).json()
status = poll_result['data']['task_status']
if status == 'succeed':
print(poll_result['data']['task_result']['videos'][0]['url'])
break
if status == 'failed':
print(poll_result['data']['task_status_msg'])
break
time.sleep(10)
# Step 1: Submit generation request with image, video, and audio references
curl -X POST https://api.flaq.ai/api/v1/video/task \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model_name": "minimax-h3-reference-to-video",
"prompt": "Use image one for the subject, video one for the movement, and audio one for the atmosphere",
"resolution": "2k",
"duration": 8,
"aspect_ratio": "16:9",
"images": ["https://example.com/subject-reference.jpg"],
"videos": ["https://example.com/motion-reference.mp4"],
"audios": ["https://example.com/atmosphere-reference.mp3"]
}'
# Use the @ (AT) reference feature in prompt through <<<...>>> placeholders.
# Placeholder numbering is 1-based for each media array:
# <<<image_1>>> = images[0], <<<image_2>>> = images[1]
# <<<video_1>>> = videos[0], <<<audio_1>>> = audios[0]
curl -X POST https://api.flaq.ai/api/v1/video/task \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model_name": "minimax-h3-reference-to-video",
"prompt": "Place the explorer from <<<image_1>>> in the environment from <<<image_2>>>, following the camera movement in <<<video_1>>> and speaking with the reference voice from <<<audio_1>>>",
"resolution": "2k",
"duration": 10,
"aspect_ratio": "16:9",
"images": [
"https://example.com/explorer-reference.jpg",
"https://example.com/environment-reference.jpg"
],
"videos": ["https://example.com/camera-movement-reference.mp4"],
"audios": ["https://example.com/voice-reference.mp3"]
}'
# Step 2: Poll for results
# Replace {task_id} with the task_id returned from the submit response
curl -X GET "https://api.flaq.ai/api/v1/video/{task_id}" \
-H "Authorization: Bearer YOUR_API_KEY"
| Tham số | Giá | Giá gốc | Giảm giá |
|---|
API chuyển tham chiếu thành video MiniMax H3 tạo các chuỗi video từ câu lệnh và một bộ tham chiếu hình ảnh hoặc âm thanh. Ứng dụng có thể sử dụng đầu vào hình ảnh, video và âm thanh để định hướng đặc điểm nhận diện của chủ thể, phong cách, hướng cảnh và chuyển động, đồng thời duy trì quy trình phù hợp với hoạt động sản xuất sáng tạo có cấu trúc trên Flaq AI.
Đầu vào tham chiếu đa phương thức: Kết hợp tham chiếu hình ảnh, video và âm thanh để cung cấp bối cảnh sáng tạo phong phú hơn cho tác vụ tạo.
Kiểm soát vai trò tham chiếu: Giải thích cách mỗi tham chiếu tác động đến chủ thể, môi trường, phong cách, âm thanh hoặc chuyển động trong chuỗi được yêu cầu.
Tính nhất quán của chủ thể và phong cách: Sử dụng tài liệu tham chiếu để duy trì sự đồng nhất của chủ thể dễ nhận biết, ngôn ngữ hình ảnh và định hướng chiến dịch xuyên suốt các clip được tạo.
Phát triển cảnh theo câu lệnh: Thêm chỉ dẫn bằng ngôn ngữ tự nhiên về hành động, chuyển động máy quay, bố cục, nhịp độ và bầu không khí.
Quy trình tham chiếu linh hoạt: Xây dựng công cụ sáng tạo kết hợp nhiều tài nguyên tham chiếu trong khi vẫn giữ luồng tác vụ do ứng dụng kiểm soát.
Hỗ trợ xem xét sản xuất: Theo dõi tác vụ tạo và xem xét clip kết quả về tính nhất quán hình ảnh, lỗi không mong muốn và mức độ tuân thủ tham chiếu.
Đầu vào: Một hoặc nhiều tham chiếu hình ảnh, video hoặc âm thanh được hỗ trợ cùng với câu lệnh tạo bằng ngôn ngữ tự nhiên.
Ánh xạ tham chiếu: Mô tả vai trò của từng đầu vào và xác định đặc điểm chủ thể, phong cách, chuyển động hoặc âm thanh mà đầu vào đó cần định hướng.
Đầu ra: Một chuỗi video đã tạo được trả về qua quy trình tác vụ Flaq AI để xem xét và xử lý tiếp.
Xử lý tác vụ: Lưu mã định danh tác vụ, thăm dò cho đến khi hoàn tất và kiểm tra clip trước khi xuất bản hoặc chỉnh sửa thêm.
Kiểm soát sáng tạo: Sử dụng các thiết lập thời lượng, độ phân giải, tỷ lệ khung hình và tham chiếu hiện có cho quy trình mục tiêu.
Tính liên tục của nhân vật và chủ thể: Giữ cho nhân vật, sản phẩm hoặc chủ thể hình ảnh dễ nhận biết nhất quán trong các cảnh mới.
Sản xuất chiến dịch thương hiệu: Kết hợp tham chiếu phong cách, tài nguyên chiến dịch và định hướng âm thanh để khám phá các biến thể sáng tạo đồng bộ.
Phát triển bảng phân cảnh và cảnh quay: Sử dụng nhiều tham chiếu để định hướng bố cục cảnh, chuyển động máy quay và tính liên tục hình ảnh.
Công cụ sáng tạo đa phương thức: Xây dựng ứng dụng cho phép người dùng định hướng quá trình tạo bằng hình ảnh, video và âm thanh thay vì chỉ bằng văn bản.
Quy trình biến thể tài nguyên: Tạo các phương án thay thế có kiểm soát trong khi duy trì ngôn ngữ hình ảnh của nguồn sáng tạo hiện có.
Lưu ý Chất lượng tham chiếu, độ rõ ràng của câu lệnh và vai trò được gán cho từng đầu vào sẽ ảnh hưởng đến kết quả cuối cùng. Hãy kiểm tra tính nhất quán của hình ảnh và âm thanh trước khi dùng nội dung được tạo trong sản xuất.
MiniMax H3 so với Kling 3.0 chuyển tham chiếu thành video: Kling cung cấp khả năng tạo video theo tham chiếu mạnh mẽ. MiniMax H3 tạo khác biệt bằng quy trình đa phương thức có thể kết hợp tham chiếu hình ảnh, video và âm thanh trong một định hướng sáng tạo.
MiniMax H3 so với Seedance 2.0 chuyển tham chiếu thành video: Seedance 2.0 hỗ trợ nhiều chế độ tạo nội dung nghe nhìn. MiniMax H3 là lựa chọn tập trung cho ứng dụng cần xây dựng cảnh theo tham chiếu và kiểm soát tác vụ.
MiniMax H3 so với Vidu Q3 chuyển tham chiếu thành video: Vidu Q3 được thiết kế để tạo video nhất quán dựa trên tham chiếu. MiniMax H3 nhấn mạnh khả năng ánh xạ câu lệnh linh hoạt trên nhiều loại phương tiện tham chiếu.
MiniMax H3 so với Wan 2.7 chuyển tham chiếu thành video: Wan 2.7 hỗ trợ tham chiếu hình ảnh, video và âm thanh cho quy trình đa phương thức. MiniMax H3 mang đến một khái niệm dựa trên tham chiếu tương đương với hướng tích hợp MiniMax riêng biệt.
MiniMax H3 so với tính năng tham chiếu của Runway Gen-4: Runway cung cấp không gian làm việc hình ảnh rộng xoay quanh các tham chiếu. MiniMax H3 phù hợp với các nhóm muốn cung cấp khả năng tạo dựa trên tham chiếu thông qua sản phẩm API hoặc chuỗi nội dung riêng.
Khám phá nhiều công cụ tạo AI cho quy trình hình ảnh và video nhanh ngay trong trình duyệt, rồi mở rộng các ý tưởng thành công bằng API model sẵn sàng cho sản xuất của Flaq AI. Flaq AI cung cấp một lớp API thống nhất cho tất cả model, giúp dễ dàng sử dụng và mở rộng quy trình của bạn.

Tạo hình ảnh AI từ prompt văn bản

Tạo hình ảnh AI từ hình ảnh và prompt văn bản

Tạo video AI từ prompt văn bản

Biến hình ảnh thành video AI

Tạo hình ảnh và video AI trong một không gian làm việc hợp nhất

Tạo video nhất quán từ nội dung đa phương tiện tham chiếu

Xây dựng quy trình hình ảnh và video AI trực quan trên canvas vô hạn
Bản phát hành mới Wan 3.0 hiện đã có trên Flaq AI cho tác vụ tạo video từ hình ảnh. Nó mang đến cho người sáng tạo một cách thức có cấu trúc để tạo chuyển động từ khung hình đầu vào bắt buộc đến khung hình cuối vào bắt buộc, với chuyển động được hướng dẫn bằng prompt, âm thanh tùy chọn, kiểm soát seed, năm tỷ lệ khung hình và đầu ra từ 480p đến 1080p. Đối với việc tạo video mang tính điện ảnh, khả năng kiểm soát từ điểm đầu đến điểm cuối đó có thể quan trọng hơn chỉ riêng độ phân giải.
API MiniMax H3 mang đến cho các nhóm làm video một tổ hợp hữu ích: tạo video từ hình ảnh, các tùy chọn đầu ra 768p và 2K, các đoạn clip dài tới 15 giây, và mức chi phí được niêm yết thấp hơn so với một số thiết lập Seedance 2.0 tương đương. MiniMax cũng đã công bố trọng số H3-Base trên Hugging Face, mở ra những lựa chọn mới cho nghiên cứu, quy trình tùy chỉnh và thử nghiệm tự lưu trữ ở những nơi giấy phép của nó cho phép.