차세대 음성 기술 제미나이 3.1 플래시 TTS 구글이 표현력을 한층 개선한 새로운 음성 모델로 공개





새로운 음성 합성 기술의 등장

구글이 음성 표현력과 제어 기능을 대폭 향상시킨 새로운 음성 합성 모델을 발표했다.

제미나이 3.1 플래시 TTS라는 이름의 이 모델은 텍스트를 음성으로 바꿔주는 기술로, 개발자와 기업, 일반 이용자 모두 사용할 수 있도록 순차적으로 제공된다.

뛰어난 성능 평가

수천 건의 블라인드 테스트를 거친 결과, 이 모델은 1211점의 높은 점수를 받으며 구글이 지금까지 내놓은 것 중 가장 자연스럽고 감정 표현이 풍부한 음성을 만들어낸다는 평가를 받았다. 높은 품질을 유지하면서도 비용 부담이 적은 최적의 모델로 인정받고 있다.

오디오 태그 기능

핵심 기술은 ‘오디오 태그’다. 이용자가 일상 언어로 지시사항을 입력하면, 음성의 스타일, 빠르기, 억양, 감정 등을 세밀하게 조절할 수 있다. 특정 상황의 분위기나 인물의 감정을 설명하면 모델이 이를 이해하고 생생한 음성을 만들어낸다.

여러 사람의 대화 지원

이전 시스템은 대화하는 사람마다 따로 처리해야 해서 대화가 자연스럽지 못했지만, 이번 모델은 여러 사람이 주고받는 대화를 한 번에 생성할 수 있다. 팟캐스트, 드라마, AI 비서 등 다양한 분야에서 활용도가 높아질 것으로 보인다.

연출 모드와 편의 기능

‘디렉터 모드’를 통해 장면과 인물 역할을 설정하고 음성 콘텐츠를 연출할 수 있다. 화자별 음성 프로필을 만들고 문장 중간에도 표현을 바꿀 수 있으며, 완성된 설정은 코드로 저장해 다른 프로젝트에서도 동일하게 사용할 수 있다.

다양한 언어 지원

70개가 넘는 언어를 지원하며, 각 언어의 억양과 사투리까지 반영할 수 있다. 이를 통해 전 세계를 대상으로 하는 서비스에서 지역별로 맞춤화된 음성 경험을 제공할 수 있게 됐다.

신뢰성 확보 장치

AI가 만든 음성의 오남용을 막기 위해 구글은 모든 생성 음성에 신스ID 워터마킹 기술을 적용했다. 사람이 듣기에는 차이가 없지만 AI가 만든 콘텐츠인지 확인할 수 있는 정보를 삽입해, 거짓 정보 확산을 방지하고 투명성을 높이려는 목적이다.

댓글 남기기