Column
영상 생성 AI, 프롬프트 한 글자에 왜 뒤집히나
이미지-투-비디오 생성의 불안정성을 프롬프트·시드 이중 최적화로 잡은 논문의 구조와 근거를 분리해 읽는다

같은 사진, 같은 문장인데 CFG 값 하나만 바꿨을 뿐인데 완전히 다른 영상이 나온다 — 그리고 그 문장을 한 단어 고쳤을 뿐인데도 결과는 또 뒤집힌다. 여기서 CFG(Classifier-Free Guidance)는 모델이 텍스트 지시를 얼마나 강하게 따르도록 만들지 정하는 값이고, 시드(seed)는 생성 과정의 난수 시작값이다. Image-to-Video 모델—정지 이미지와 텍스트 설명을 넣으면 짧은 동영상을 만들어내는 모델—을 실무 파이프라인에 넣어본 사람이라면 누구나 겪는 이 장면에서, "Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence"라는 논문은 '더 잘 쓴 프롬프트' 대신 두 개의 탐색 루프를 제안한다.
왜 프롬프트만 고쳐서는 안 되는가
이 논문은 I2V 모델이 실제로 받는 입력이 프롬프트 하나가 아니라고 짚는다. 3장 Methodology는 프레임워크가 "the two primary inputs to a black-box I2V model: the textual prompt and its core hyperparameters"를 동시에 최적화한다고 설명하는데, 번역하면 블랙박스 I2V 모델에 들어가는 두 가지 핵심 입력이 텍스트 프롬프트와 하이퍼파라미터라는 뜻이다 arXiv — 3 Methodology.

5장 Discussion은 여기서 한 걸음 더 나가 문제의 뿌리를 두 갈래로 못박는다. "the two primary sources of variance—the prompt and the hyperparameters"라는 문장인데, 결과가 들쭉날쭉한 원인이 분산의 두 가지 주요 원천, 곧 프롬프트와 하이퍼파라미터에 있다는 것이다 arXiv — 5 Discussion. 프롬프트를 아무리 다듬어도 시드나 CFG가 그대로 확률에 맡겨져 있다면 결과는 여전히 불안정하고, 반대로 시드와 CFG를 고정해도 프롬프트 표현 하나가 결과를 뒤집는다. 비슷한 문제의식은 이 논문에만 있는 것도 아니다. VISTA라는 별도 연구도 사용자가 원하는 결과를 얻을 때까지 문구를 반복해서 다듬고 결과물을 걸러내야 하는 고된 순환을 지적한다 VISTA. 이 논문의 차별점은 그 두 변수를 각각 별도의 최적화 대상으로 분리했다는 데 있다.
생성기와 비평가, 두 역할로 나눈 구조
프레임워크 전체는 하나의 비유로 요약된다. 5장 Discussion은 이를 "a 'generator-critic' loop where the I2V model acts as the generator and the mLLM functions as a sophisticated visual critic"라고 표현한다. I2V 모델이 영상을 만드는 생성자 역할을, mLLM(멀티모달 대형언어모델—텍스트뿐 아니라 이미지·영상도 이해하는 언어모델)이 그 결과를 채점하는 정교한 시각 비평가 역할을 맡는 생성기-비평가 루프라는 것이다 arXiv — 5 Discussion. 이 논문에서 비평가로 쓰인 mLLM은 Gemini-2.5-pro이며, 영상 이해 벤치마크에서 좋은 성능을 낸다는 이유로 채택됐다 arXiv — 3 Methodology.
Figure 1이 그리는 전체 구조는 위아래 두 개의 서브시스템으로 나뉜다. 위쪽은 Prompt Optimization, 아래쪽은 Hyperparameter Optimization이다 arXiv — 3 Methodology. 이 구조가 '더 나은 프롬프트 한 줄을 찾는다'는 흔한 프롬프트 엔지니어링과 다른 지점은, 프롬프트 탐색과 하이퍼파라미터 탐색이 각각 독립된 닫힌 루프로 돌아간다는 것이다. 생성자가 영상을 뽑으면 비평가가 채점하고, 그 채점 결과가 다시 생성자에게 다음 시도의 방향을 알려준다. 단순히 여러 번 뽑아서 사람이 고르는 방식과 달리, 채점과 수정이 매 회차마다 자동으로 맞물려 돈다.
채점표를 만드는 법: DSG와 CMQ, 그리고 VTA 점수
프롬프트 최적화 단계에서 비평가가 쓰는 채점표는 두 축으로 구성된다. 첫째는 Davidsonian Scene Graph(DSG) 질문으로, 프롬프트를 등장인물의 존재·행동·상태·소유·위치 같은 검증 가능한 항목으로 분해한다. 논문이 든 예시는 "A group of women sitting on the steps of a building"라는 프롬프트를 "Is the group of women present", "Are the women sitting down?", "Are the women sitting on steps?" 같은 질문으로 쪼개는 과정이다 arXiv — 3 Methodology.
둘째는 Common Mistake Questions(CMQ)로, DSG가 놓치기 쉬운 영상 생성 모델의 실패 유형을 겨냥한다. 논문이 제시하는 실제 예시는 "Are the anatomical features of the characters depicted correctly and consistently?"와 "Are the facial features of the women stable and free from distortion or flickering?"이다. 각각 인물의 해부학적 특징이 일관되게 표현됐는지, 얼굴이 흔들리거나 왜곡 없이 안정적인지를 확인하는 질문이다 arXiv — 3 Methodology. 이 두 질문 세트의 '예' 응답 비율은 나중에 Video-Text Adherence(VTA) 점수로 재활용되어 하이퍼파라미터 탐색의 목적함수에 들어간다 arXiv — 3 Methodology.
이 채점 자체가 믿을 만한지도 논문은 따로 검증했다. Gemini 2.5 Pro의 답변을 사람이 매긴 정답과 비교한 결과, DSG 질문 정확도는 92%, CMQ 질문 정확도는 82%, 전체 87%였다 arXiv — 3 Methodology. CMQ 쪽 정확도가 더 낮다는 건 시간적 결함을 판별하는 일이 사실 관계를 확인하는 것보다 더 어렵다는 뜻으로 읽을 수 있다.
루프가 실제로 도는 순서: 프롬프트 먼저, 그다음 시드·CFG
파이프라인은 정확히 두 단계를 순서대로 거친다. 첫 단계인 프롬프트 정제 루프는 이렇게 돈다. I2V 모델이 현재 프롬프트로 영상을 만들고, mLLM VQA(시각 질의응답) 시스템이 DSG·CMQ 질문 전체에 '예/아니오'로 답하며 정합 점수를 매긴다. '아니오'로 답한 질문들을 근거로 mLLM이 프롬프트를 다시 쓰고, 이 과정을 고정된 횟수만큼 반복한 뒤 가장 높은 점수를 받은 프롬프트가 다음 단계로 넘어간다 arXiv — 3 Methodology.
두 번째 단계는 그 최선의 프롬프트를 고정한 채로만 작동한다. 베이지안 최적화(적은 시도로도 다음에 시도할 값을 효율적으로 좁혀가는 탐색 기법)가 시드와 CFG 스케일을 동시에 탐색하면서, UVQ(영상 품질 모델)와 RAHF(사람 선호 예측 모델), 그리고 앞서 만든 VTA 점수를 합친 다목적 함수를 최대화한다 arXiv — 3 Methodology. 즉 프롬프트는 먼저 확정되고, 시드·CFG는 그 확정된 프롬프트 안에서만 탐색 대상이 된다. 논문 스스로도 이 순서를 한계로 인정한다. 프롬프트와 하이퍼파라미터를 동시에 최적화하면 둘 사이의 숨은 상호작용을 찾아낼 수 있는데, 지금 구조는 두 단계를 나눠서 처리하기 때문에 그런 상호작용을 놓칠 수 있다는 것이다 arXiv — 5 Discussion.
'많이 뽑아서 고르면 되지 않나'라는 오해
가장 자연스러운 반론은 이렇다. 베이지안 탐색 없이 그냥 여러 번 무작위로 뽑아서 제일 나은 걸 고르면 되지 않을까. Table 2는 이 질문에 두 단계로 답한다. 먼저 10회 예산에서 무작위 기준선과 비교하면, 논문의 방법은 승률 4247%를 기록하고 무작위 기준선은 614%에 그친다 arXiv — 4 Experiments. 예산을 100회로 늘려도 여전히 순수 무작위 대비로는 격차가 더 벌어져, 방법 쪽 승률이 6069%까지 오르고 무작위 기준선은 810%에 머문다 arXiv — 4 Experiments. 앞서 핵심 주장에서 언급한 '최대 69%'라는 수치는 바로 이 100회 예산·순수 무작위 비교의 RAHF 지표에서 나온다.
그런데 논문은 여기서 멈추지 않고 더 까다로운 비교를 붙인다. 100회 생성한 뒤 무작위 후보 중에서도 논문과 똑같은 아티팩트 필터와 랭킹 지표로 최선을 고르는 'Best-of-Random' 기준선을 세운 것이다. 이 조건에서는 방법의 승률이 2842%로 낮아지고, 무작위 기준선도 815%로 소폭 오르며, 무승부 비율이 48~57%까지 커진다 arXiv — 4 Experiments. 해석하자면, 상대가 단순 운이 아니라 같은 채점 기준으로 최선을 골라낼 자격을 갖췄을 때는 베이지안 탐색의 우위가 눈에 띄게 좁아진다는 뜻이다. 다만 네 가지 랭킹 지표 어느 쪽으로 봐도 방법이 기준선보다 낮아진 경우는 없다. 논문은 이 결과가 통계적으로 유의미하다는 것을 이항 부호 검정과 95% Wilson 신뢰구간으로 확인했다고 밝힌다 arXiv — 4 Experiments.
모델에 상관없이 붙는다는 주장, 어디까지 검증됐나
논문은 이 프레임워크를 "a model-agnostic wrapper that fundamentally applies to any latent diffusion video model", 곧 어떤 잠재 확산 영상 모델에도 근본적으로 적용되는 모델 무관 래퍼라고 표현한다 arXiv — 4 Experiments. 이 문장만 보면 임의의 영상 생성 모델에 그대로 얹을 수 있다는 뜻으로 읽히기 쉽다.
하지만 실제 실험은 한 가지 모델, Veo 2.0으로만 수행됐고, 분석의 기준 프롬프트도 V-Bench의 image-and-prompt-to-video 과제에서 가져왔다 arXiv — 4 Experiments. 즉 '모델 무관'이라는 주장은 구조 설계상의 일반성—프롬프트와 하이퍼파라미터를 다루는 외부 래퍼이므로 내부 모델 구조를 몰라도 된다는 의미—에 해당하고, 여러 모델에 걸쳐 실제로 승률을 재현했다는 실증까지는 아니다. 다른 I2V 모델에 붙였을 때도 같은 폭의 개선이 나오는지는 이 논문 안에서 확인되지 않는다.
남은 질문
이 프레임워크가 검증한 것은 탐색을 구조화하면 무작위보다 낫다는 것이지, 몇 번 시도하면 충분한가는 아니다. 순수 무작위와 비교했을 때 10회에서 벌어졌던 격차가 Best-of-Random과 비교하면 크게 좁아진다는 Table 2 자체가, 계산 예산을 늘릴지 탐색 전략을 정교화할지는 여전히 사용자의 판단으로 남아있다는 뜻이다. 논문도 이 지점을 한계로 인정하며, mLLM 비평가를 매번 호출하는 계산 비용이 여전히 크고, 더 표본 효율적인 최적화나 비평가를 가벼운 보상 모델로 압축하는 방향이 후속 과제로 남아 있다고 밝힌다 arXiv — 5 Discussion. 프롬프트와 하이퍼파라미터를 동시에 최적화하는 결합형 탐색도 아직 시도되지 않은 채 남아 있다.
함께 읽기
- CLAUDE.md는 왜 끝없이 커지는가 — 치명적 기억 과잉(Catastrophic Remembering)
- 스킬을 압축해야 하는 이유 — SkillZip의 구조적 압축 실측 31.2%
- LinkedIn이 운영 중인 자가진화 에이전트 — 2주 A/B 실측 +9.0pp