AI 영상의 첫 장면은 잘 나왔는데 두 번째 장면에서 같은 인물의 얼굴과 목소리가 달라지는 일이 흔하다. Veo는 이전 인물을 배우처럼 자동 고정하지 않고 생성할 때마다 얼굴과 음성을 새롭게 해석할 수 있다.
먼저 인물의 나이, 머리, 안경, 옷과 눈에 띄는 특징을 짧은 블록으로 만들고 모든 장면에 글자까지 동일하게 사용한다. 분위기 같은 추상어보다 화면에서 확인할 요소가 유용하다.
복잡한 캐릭터 시트보다 정면 얼굴과 전신이 분명한 깨끗한 참조 이미지부터 시험한다. 최근 커뮤니티에도 여러 각도를 한 장에 넣기보다 정면·뒷모습을 단순하게 제공했을 때 결과가 나았다는 경험이 있다. 공식 보장 공식은 아니므로 직접 비교해야 한다.
한 장면에 걷기, 대화와 카메라 회전을 모두 넣지 말고 문을 여는 컷, 앉은 상반신, 한 문장을 말하는 얼굴처럼 나눈다. 이전 영상의 마지막 프레임을 다음 영상의 첫 프레임으로 활용할 수도 있다. 모든 8초 Veo 3.1 영상은 연장할 수 있지만 연장 작업에는 Lite 모델을 사용해야 한다.
목소리도 나이, 높낮이, 속도와 억양을 고정 블록으로 반복한다. 그래도 컷마다 달라지면 계속 재생성하기보다 완성 영상의 음성을 분리해 같은 외부 음성으로 교체하는 편집 방법을 고려한다. 이 경우 외부 서비스 비용과 음성 사용 권리·동의를 확인해야 한다.
가장 현실적인 순서는 대표 이미지 제작, 고정 설명 작성, 대사 없는 컷으로 외모 확인, 한 화자·한 문장 시험, 마지막에 편집과 음성 통일이다.
관련 글
같은 맥락에서 이어서 읽기 좋은 글들입니다.