
FLUX 3로 비디오 생성하는 방법
Jul 2026
FLUX 3는 Black Forest Labs의 새로운 멀티모달 프론티어 모델로, 2026년 7월 23일 얼리 액세스로 출시되었습니다. 하나의 아키텍처로 이미지, 최대 20초 길이의 비디오, 동기화된 오디오, 그리고 액션 예측을 생성합니다.
영화 제작자들에게 FLUX 3는 대화, 효과음, 앰비언스, 그리고 영상이 동일한 생성 과정에서 나올 수 있는 최초의 주요 AI 비디오 출시 중 하나입니다. 이 가이드는 FLUX 3가 무엇을 할 수 있는지, FLUX로 비디오를 생성하는 방법, 현재 실제로 사용 가능한 것이 무엇인지, Seedance, Kling, Veo, Grok과 어떻게 비교되는지, 그리고 Flick 영화 제작 워크플로우에서 FLUX 스타일 출력물을 사용하는 방법을 설명합니다.
빠른 답변: FLUX가 비디오를 생성할 수 있나요?
네. FLUX 3는 비디오를 생성할 수 있습니다. 출시 시점에 Black Forest Labs는 FLUX 3 Video를 최대 20초 길이의 클립을 생성할 수 있으며, 선택적으로 네이티브 동기화 오디오를 제공하는 텍스트-투-비디오 모델로 설명합니다.
| 질문 | 답변 |
|---|---|
| FLUX가 비디오를 생성할 수 있나요? | 네, FLUX 3 Video를 통해 가능합니다 |
| 주요 워크플로우 | 텍스트-투-비디오, 더 광범위한 모델 패밀리에서 이미지/비디오 워크플로우 예정 |
| 최대 클립 길이 | 최대 20초 |
| 오디오 | 네이티브 동기화 오디오, 선택 사항 |
| 이미지 생성 | 초기 Video/Action 액세스 이후 전체 이미지 생성 출시 예정 |
| 액세스 | 신청을 통한 얼리 액세스 |
| 가격 | 미발표 |
| 오픈 웨이트 | 2026년 후반 공개 예정 |
| 최적 용도 | 시네마틱 클립, 영상-사운드 통합 테스트, 대화 장면, 사운드 인식 B-롤, 멀티모달 영화 실험 |
Flick에서 영화를 만드세요
새로운 모델이 빠르게 추가됩니다. 캐릭터, 스토리, 편집은 언제나 당신의 것입니다.
FLUX 3 출시
Black Forest Labs는 2026년 7월 23일에 FLUX 3를 이미지, 비디오, 오디오, 액션을 아우르는 멀티모달 모델 패밀리로 발표했습니다. 출시의 핵심 메시지는 간단합니다: 이미지용 모델 하나, 비디오용 모델 하나, 오디오용 모델 하나, 액션 예측용 모델 하나를 각각 훈련하는 대신, FLUX 3는 여러 양식에 걸쳐 하나의 아키텍처를 사용합니다.

BFL CEO Robin Rombach는 이 전제를 이렇게 요약했습니다: "현실을 속일 수는 없습니다. 이미지만 학습한 모델은 이미지만 생성할 수 있습니다." 이 관점이 영화 제작자에게 중요한 이유는 AI 비디오의 가장 어려운 부분이 더 이상 단일의 아름다운 프레임이 아니기 때문입니다. 연속성입니다: 영상, 모션, 사운드, 캐릭터, 물리, 그리고 편집 리듬이 모두 일치해야 합니다.
영화 제작자에게 중요한 스펙
| 기능 | 출시 시점의 FLUX 3 |
|---|---|
| 비디오 | 생성당 최대 20초의 텍스트-투-비디오 |
| 오디오 | 네이티브 동기화 오디오, 영상과 함께 생성되며 선택 사항 |
| 이미지 | 전체 이미지 생성, 초기 출시 단계 이후 순차 출시 |
| 아키텍처 | 이미지, 비디오, 오디오, 액션을 아우르는 하나의 모델, BFL이 "Self-Flow"로 설명 |
| 벤치마크 | BFL은 FLUX 3가 비교 테스트에서 Runway Gen-4.5보다 77% 선호되었다고 보고 |
| 변형 | FLUX 3 Video, FLUX 3 Image, FLUX 3 Action, FLUX 3 Dev, FLUX-mimic |
| 오픈 웨이트 | 2026년 후반 공개 예정 |
| 액세스 | Black Forest Labs에서 신청을 통한 얼리 액세스 |
| 얼리 테스터 | Canva, Burda, Magnific, Krea, Picsart, Audi 등 |
독립적인 테스트가 따라잡을 때까지 벤치마크 수치는 벤더 주장으로 간주하세요. 더 중요한 실질적인 포인트는 FLUX 3가 비디오와 오디오를 하나의 생성 과정에서 결합한다는 점이며, 이는 영화 제작자에게 즉각적인 워크플로우 영향을 미칩니다.
사람들이 FLUX 3로 만들고 있는 것
얼리 액세스 테스터들은 출시 전에 모델을 사용했으며, 초기 사례들은 영화 제작자들이 주목하는 이유를 보여줍니다: 시네마틱 프레이밍, 강력한 조명, 일관된 모션, 그리고 동일한 시스템 내의 네이티브 오디오 잠재력.


예시들은 아직 초기 단계이지만, 올바른 평가 기준을 제시합니다. FLUX 3을 정지 프레임의 아름다움만으로 판단하지 마세요. 모션, 사운드, 타이밍, 씬 로직이 함께 잘 유지되는지로 판단하세요.
FLUX로 비디오 생성하는 방법
1. 막연한 아이디어가 아닌 구체적인 샷으로 시작하세요
FLUX 3이 텍스트-투-비디오를 지원하지만, 좋은 비디오 프롬프트는 여전히 샷 지시입니다. 하나의 구체적인 샷으로 시작하세요:
- 프레임 안에 누가 또는 무엇이 있나요?
- 카메라는 어디에 있나요?
- 무엇이 움직이나요?
- 시간에 따라 무엇이 변하나요?
- 오디오에는 무엇이 포함되어야 하나요?
- 모델이 무엇을 피해야 하나요?
약한 프롬프트:
밤의 미래 도시.
더 나은 프롬프트:
비에 젖은 밤의 미래 도시 위로 느리게 이동하는 항공 촬영. 네온 사인이 아래 웅덩이에 반사되고, 거리 통풍구에서 증기가 올라오며, 먼 곳에서 교통 소음이 들리고, 낮은 신스 드론이 샷 아래에서 쌓입니다. 시네마틱 리얼리즘, 젖은 아스팔트, 볼류메트릭 라이트, 읽을 수 있는 텍스트 없음, 로고 없음.
두 번째 프롬프트는 FLUX에게 시각적 및 오디오 지시를 모두 제공합니다.

2. 영상과 사운드를 함께 고려한 프롬프트 작성하기
FLUX 3이 중요한 이유 중 하나는 네이티브 동기화 오디오로, Seedance 2.5와 같은 모델과 함께 생성됩니다. 프롬프트에서 이를 활용하세요.
강력한 FLUX 프롬프트에는 다음이 포함되어야 합니다:
- 카메라: 푸시인, 돌리, 핸드헬드, 고정, 항공, 트래킹, 오빗.
- 피사체 모션: 걷기, 돌기, 뻗기, 달리기, 망설이기, 올려다보기.
- 환경 모션: 비, 연기, 바람, 먼지, 군중, 불, 물.
- 사운드: 발소리, 옷 소리, 엔진 소음, 천둥, 대화, 주변음, 정적.
- 타이밍: "2초 후", "카메라가 그들에게 도달할 때", "마지막에".
- 제약사항: 텍스트 없음, 추가 캐릭터 없음, 정체성 유지, 현실적인 모션.
예시:
Locked-off medium shot of a tired astronaut sitting alone inside a dim spacecraft cockpit.
At the start, only the soft instrument panel glow lights their face. After three seconds, a red warning light begins pulsing.
The astronaut slowly turns toward the window as distant debris taps against the hull.
Audio: low spacecraft hum, faint alarm pulse, subtle breathing inside the helmet, no music.
Cinematic realism, shallow depth of field, no text, no extra characters.
3. 첫 번째 테스트는 단순하게 유지하세요
초기 FLUX 생성의 경우, 너무 복잡한 안무가 필요한 씬은 피하세요. 피사체 하나, 카메라 아이디어 하나, 사운드 아이디어 하나를 사용하세요.
좋은 첫 테스트:
- 발소리가 동기화된 빗속을 걷는 사람.
- 충격음과 매칭되는 문 닫히는 장면.
- 맥동하는 적색 조명과 함께 울리는 우주선 조종석 경보.
- 낮은 으르렁거림과 앰비언스가 있는 안개 속에서 나타나는 괴물.
- 룸톤이 있는 조용한 대화 리액션 샷.
- 엔진 소리와 타이어 소리가 있는 카메라 앞을 지나가는 자동차.
위험도가 높은 테스트:
- 정확한 립싱크가 필요한 다인 대화.
- 복잡한 격투 안무.
- 읽을 수 있는 간판이나 인터페이스 텍스트.
- 하나의 프롬프트에서 여러 장소를 연결하는 시퀀스.
- 정확한 브랜드 로고.
- 연기의 연속성이 필요한 긴 감정적 비트.
4. 배리에이션을 생성하고 시퀀스 가치로 비교하기
"어떤 클립이 가장 좋아 보이나요?"만 묻지 마세요. "어떤 클립이 가장 잘 편집되나요?"를 물으세요.
배리에이션을 검토할 때 확인할 사항:
- 첫 프레임이 이전 씬과 일치하나요?
- 마지막 프레임이 유용한 컷 포인트를 만드나요?
- 사운드가 편집에 도움이 되나요, 아니면 방해가 되나요?
- 액션이 설명 없이도 명확하게 읽히나요?
- 클립이 피사체의 정체성을 유지하나요?
- 움직임이 물리적으로 그럴듯하게 느껴지나요?
최고의 FLUX 결과물은 가장 화려한 것이 아닐 수 있습니다. 다른 샷들과 자연스럽게 어울릴 수 있는 것이 최고입니다.
5. 더 깔끔할 때는 짧은 결과물 사용하기
FLUX 3은 최대 20초까지 광고하지만, 모든 클립이 20초여야 한다는 의미는 아닙니다. AI 비디오는 샷이 명확하고 구체적인 목적을 가질 때 가장 강력해 보이는 경우가 많습니다.
5–8초를 사용할 경우:
- 설정 샷.
- 컷어웨이.
- 인서트 샷.
- 리액션 샷.
- 사운드가 있는 텍스처 샷.
- 모션 테스트.
10–20초를 사용할 경우:
- 피사체가 안정적으로 유지됩니다.
- 액션에 시작, 중간, 끝이 있습니다.
- 오디오 퍼포먼스가 중요합니다.
- 샷에 여유가 필요합니다.
- 클립이 완전한 마이크로 씬으로 의도되었습니다.
FLUX 비디오 프롬프트 템플릿
다음 구조를 사용하세요:
[Shot type / camera movement] of [subject] in [setting].
[Subject action over time].
[Environmental motion over time].
Audio: [dialogue, ambience, effects, silence, music direction].
Style: [cinematic style, lens, lighting, texture].
Constraints: [identity, no text, no logos, no extra characters, realistic motion].
예시:
Slow handheld tracking shot behind a detective walking down a narrow motel hallway at midnight.
The detective moves cautiously, one hand near the wall, then stops when a door creaks open at the end of the hall.
Fluorescent lights flicker overhead, dust floats in the air, rain runs down the window at the far end.
Audio: soft footsteps on carpet, low motel electricity hum, distant rain, one sharp door creak, no music.
1970s neo-noir, 35mm film grain, warm green fluorescent cast, realistic motion.
No readable text, no logos, no extra people.
FLUX 3 비디오 프롬프트 예시
대화 순간
Close-up of an exhausted pilot in a dim cockpit, helmet visor half raised.
The pilot looks down, breathes once, then says quietly: "We are not going back."
Warning lights pulse across their face as the camera slowly pushes in.
Audio: cockpit hum, soft alarm beeps, intimate dry dialogue, no music.
Cinematic sci-fi realism, shallow depth of field, preserve face, no text.
사운드 우선 공포 샷
Locked-off wide shot of an empty farmhouse hallway at night.
At first nothing moves. After four seconds, a floorboard creaks off-screen, then the hanging light swings slightly.
Audio: deep room tone, distant wind, single floorboard creak, faint chain movement, no music.
Natural darkness, practical bulb light, realistic horror atmosphere, no visible monster.
제품 스타일 모션
Slow studio orbit around a matte black cinema camera on a reflective table.
Light sweeps across the lens glass as the camera rotates, revealing subtle dust particles in the air.
Audio: quiet mechanical rotation, soft room tone, no music.
Premium commercial lighting, crisp reflections, minimal background.
No logos, no text, keep object shape consistent.
장대한 외부 장면
Wide cinematic shot of ancient ships cutting through dark water at dawn.
Oars move in rhythm, sails snap in the wind, mist wraps around rocky cliffs.
Audio: waves against wood, distant sailcloth snapping, low wind, subtle drum pulse.
Historical epic realism, warm sunrise, 70mm texture, grounded scale.
No modern objects, no fantasy creatures, no readable text.
조용한 캐릭터 비트
Medium close-up of a young inventor sitting alone at a cluttered workbench before sunrise.
They tighten one small screw, stop, and smile when the machine begins to hum.
Dust floats in the first blue morning light through the window.
Audio: tiny metal screw turn, soft electric hum, morning birds outside, no music.
Naturalistic indie film style, gentle lens softness, realistic hands.
Flick에서 FLUX 사용하는 방법
FLUX 3 액세스는 현재 얼리 액세스 단계이므로, 정확한 Flick 네이티브 통합은 게시 전에 확인해야 합니다. 하지만 FLUX 출력은 표준 비디오이므로, FLUX 클립을 이미 Flick 영화 워크플로의 일부로 취급할 수 있습니다: 클립을 캔버스에 가져오고, 레퍼런스 옆에 정리하고, 다른 모델 생성 결과와 비교하고, 시퀀스에 편집할 수 있습니다.
Flick에서 FLUX 준비 프로젝트를 구축하려면:
- 새 캔버스를 엽니다. 새 Flick 프로젝트를 만들고 최종 배포용 화면 비율을 선택합니다: 16:9, 9:16 또는 1:1.
- 씬을 시각적으로 구축합니다. 텍스트 노드를 프롬프트 메모로 사용하고, 씬 스틸을 생성하고, 레퍼런스를 수집하고, 샷 계획을 캔버스에 유지합니다.
- 반복되는 캐릭터를 먼저 고정합니다. 비디오 모델에 의존하기 전에 Flick의 캐릭터 레퍼런스 워크플로를 사용하여 스틸에서 캐릭터를 고정합니다. 모든 비디오 모델이 샷 간에 변동될 수 있기 때문에 이는 중요합니다.
- FLUX 클립을 생성하거나 가져옵니다. 워크스페이스에서 FLUX를 사용할 수 있다면, 화면과 동기화된 사운드가 한 번에 필요할 때 직접 사용하세요. 얼리 액세스 기간 동안 다른 곳에서 FLUX를 생성한 경우, 비디오 파일을 캔버스로 가져옵니다.
- 모델 출력을 비교합니다. 사운드 인식 샷에는 FLUX를, 레퍼런스가 많거나 긴 클립에는 Seedance를, 강한 모션에는 Kling을, 세련된 시네마틱 리얼리즘에는 Veo를 사용합니다. 영화는 캔버스에 유지되고 모델만 샷마다 변경됩니다.
- 유용한 프레임을 추출합니다. FLUX 클립이 강력한 마지막 프레임을 생성하면, 해당 프레임을 저장하거나 추출하여 다음 샷의 레퍼런스로 사용합니다.
- 함께 그레이딩하고 편집합니다. FLUX 클립, 무음 AI 비디오 클립, 음성 클립, 음악, 편집을 같은 프로젝트에 넣어 시퀀스가 하나의 영화처럼 느껴지도록 합니다.
FLUX가 AI 영화 제작 워크플로를 변화시키는 방법
동기화된 AI 비디오 이전에는 일반적인 워크플로가 다음과 같았습니다:
- 무음 클립을 생성합니다.
- 최고의 테이크를 선택합니다.
- TTS 또는 음성 모델로 대화를 추가합니다.
- 사운드 라이브러리에서 폴리를 추가합니다.
- 앰비언스를 추가합니다.
- 음악을 추가합니다.
- 모든 것이 같은 공간에서 일어난 것처럼 느껴지도록 만듭니다.
FLUX 3는 이러한 작업의 일부를 생성 과정 자체로 통합합니다. 문이 닫히는 소리와 함께 문이 쾅 닫힐 수 있습니다. 조종석 경보음이 빨간 불빛과 함께 울릴 수 있습니다. 캐릭터가 카메라가 움직이는 같은 샷에서 말할 수 있습니다.
그렇다고 포스트 프로덕션이 무의미해지는 것은 아닙니다. 첫 번째 결과물이 더욱 영화다워지는 것입니다. 여전히 편집하고, 믹싱하고, 색보정하고, 다듬어야 하지만, 원본 생성물이 타이밍과 사운드 큐를 이미 갖춘 채로 나올 수 있습니다.
FLUX 3와 현재 AI 비디오 모델 비교
| 모델/워크플로우 | 최대 클립 길이 | 네이티브 오디오 | 텍스트-투-비디오 | 레퍼런스/일관성 | 상태 |
| FLUX 3 | 최대 20초 | 예, 동기화됨 | 예 | 정식 출시 시 확인 | 얼리 액세스 |
| Seedance 2.5 | 최대 30초 | 오디오 레퍼런스가 페이싱 조정 | 예 | 최대 50개 레퍼런스 에셋 | 롤아웃 / 베타 |
| Kling O3 | 현재 제한 확인 필요 | 현재 지원 확인 필요 | 예 | Omni Reference | 라이브 |
| Grok Imagine 1.5 | 최대 15초 | 문서화되지 않음 | 프리뷰 API에서 미지원 | 레퍼런스-투-비디오 | 라이브 |
| Veo | 모델/버전에 따라 다름 | 지원 버전에서 네이티브 오디오 | 예 | Ingredients / 레퍼런스 | 액세스 상이 |
| Flick 캔버스 | 프로젝트 레벨 워크플로우 | 프로젝트의 일부로 오디오 지원 | 멀티 모델 | 모델 간 캐릭터 레퍼런스 | 라이브 워크플로우 레이어 |
Seedance는 여전히 레퍼런스 팩 워크플로우에 중요합니다. Kling은 여전히 모션 중심 샷에 중요합니다. Veo는 여전히 세련된 사실감과 지원 버전의 네이티브 오디오에 중요합니다. Grok은 여전히 빠른 이미지-투-비디오 탐색에 중요합니다. FLUX 3의 차별화 요소는 그림과 소리가 함께 설계되는 단일 멀티모달 생성입니다.
FLUX 3가 아직 증명하지 못한 것
FLUX 3는 유망하지만, 얼리 액세스는 중요한 질문들을 답하지 못한 채로 남겨둡니다:
- 오디오를 정확하게 지시할 수 있나요? 프롬프트가 대화, 폴리, 앰비언스, 음악에 대해 얼마나 많은 제어권을 주는지 알아야 합니다.
- 같은 퍼포먼스를 유지하면서 그림을 재생성할 수 있나요? 영화 제작자는 테이크 레벨의 제어가 필요합니다.
- 샷 간 음성을 일치시킬 수 있나요? 캐릭터가 목소리 일관성을 유지할 수 있다면 네이티브 사운드가 가장 중요합니다.
- 레퍼런스가 얼마나 강력한가요? 캐릭터, 의상, 로케이션 일관성이 실제 영화에 사용할 수 있는지를 결정합니다.
- 반복 작업 비용은 얼마나 드나요? 가격이 실험용으로 사용할지 프로덕션용으로 사용할지를 결정할 것입니다.
- 약속된 가중치는 얼마나 오픈되어 있나요? 개발자 버전이 장기적으로 호스팅 릴리스보다 더 중요할 수 있습니다.
이러한 답변이 공개되기 전까지는 FLUX 3를 완성된 엔드-투-엔드 프로덕션 시스템이 아닌 중요한 새로운 기능으로 간주하세요.
더 나은 FLUX 비디오를 위한 모범 사례
- 한 번에 한 샷씩 프롬프트하세요.
- 시각적 지시뿐만 아니라 오디오 지시를 포함하세요.
- 카메라 움직임을 명확하게 지정하세요.
- 초기 테스트는 간단하게 유지하세요.
- 읽을 수 있는 텍스트와 로고는 피하세요.
- 안정성이 중요할 때는 더 짧은 클립을 사용하세요.
- 강력한 프레임을 레퍼런스로 저장하세요.
- 사운드가 편집에 도움이 되는지 확인하세요.
- 한 모델이 모든 샷에서 승리한다고 가정하지 말고 FLUX 클립을 다른 모델과 비교하세요.
- 프로젝트를 잃지 않고 모델을 교체할 수 있도록 Flick에서 영화를 정리된 상태로 유지하세요.
흔한 실수
- 프롬프트에서 오디오를 무시하기. FLUX 3의 차별화 요소는 동기화된 사운드이므로 지시하세요.
- 한 번의 생성으로 전체 씬을 요청하기. 한 클립은 한 샷이어야 합니다.
- 전체 20초를 과도하게 사용하기. 긴 클립은 액션이 일관성을 유지할 때만 더 좋습니다.
- 이미지만 판단하기. 타이밍, 사운드 디자인, 앰비언스, 퍼포먼스를 들으세요.
- 벤더 벤치마크가 최종이라고 가정하기. 독립적인 비교가 중요할 것입니다.
- 연속성을 잊기. 아름다운 클립도 여전히 캐릭터, 로케이션, 시퀀스와 일치해야 합니다.
- 하나의 완벽한 모델을 기다리기. 실제로는 샷별로 최고의 모델을 사용하고 하나의 워크플로우에서 영화를 조립하세요.
자주 묻는 질문
FLUX 3가 비디오를 생성할 수 있나요?
예. FLUX 3 Video는 최대 20초 길이의 텍스트-투-비디오 클립을 생성할 수 있으며, 선택적으로 네이티브 동기화 오디오를 포함할 수 있습니다.
FLUX로 비디오를 어떻게 생성하나요?
카메라 움직임, 피사체 동작, 환경 움직임, 스타일, 제약 조건, 오디오를 설명하는 샷 중심 프롬프트를 작성하세요. 여러 변형을 생성하고, 가장 잘 어울리는 클립을 선택한 후, 나머지 시퀀스와 함께 정리하세요.
FLUX 3가 오디오를 생성하나요?
예. FLUX 3는 동일한 패스에서 비디오와 동기화된 오디오를 생성할 수 있습니다. 이는 나중에 사운드를 추가하는 것이 아니라 영상과 사운드가 함께 생성된다는 의미입니다.
FLUX 3는 오픈 소스인가요?
아직은 아닙니다. FLUX 3는 신청을 통한 얼리 액세스로 출시되었습니다. Black Forest Labs는 2026년 후반에 오픈 웨이트 개발자 버전을 계획하고 있다고 밝혔습니다.
FLUX 3는 FLUX 2와 어떻게 다른가요?
FLUX 2는 주로 이미지 모델입니다. FLUX 3는 이미지, 비디오, 오디오, 액션 예측을 포괄하는 멀티모달 아키텍처입니다.
FLUX 3 비용은 얼마인가요?
가격은 아직 발표되지 않았습니다. 현재는 Black Forest Labs의 얼리 액세스 프로세스를 통해서만 액세스할 수 있습니다.
FLUX 3가 Runway보다 나은가요?
Black Forest Labs는 벤치마크 비교에서 FLUX 3가 Runway Gen-4.5보다 77% 더 선호되었다고 보고했습니다. 독립적인 테스트가 여전히 필요합니다.
Flick에서 FLUX 3를 사용할 수 있나요?
FLUX가 Flick 워크스페이스에서 사용 가능한 경우, 비디오 모델로 직접 사용하세요. 얼리 액세스 기간 동안 다른 곳에서 FLUX 클립을 생성한 경우, Flick 캔버스로 가져와서 레퍼런스와 함께 정리하고 프로젝트의 나머지 부분과 함께 편집하세요.
FLUX를 처음 사용할 때 무엇을 해야 하나요?
짧고 사운드를 인식하는 샷부터 시작하세요: 빗속의 발소리, 문 닫히는 소리, 대화 비트, 조종석 알람, 자동차 지나가는 소리, 또는 분위기 있는 설정 샷 등입니다. 이러한 것들은 동기화된 오디오가 실제로 시퀀스에 도움이 되는지 보여줍니다.