메뉴

검색

IT·전자

카카오, 사용자 지시 맞춰 감정·억양 조절 가능한 음성 AI 기술 구현

2026-08-04 11:46:17

말투, 속도, 감정, 억양까지 세밀하게 조절해 음성 생성 가능
한국어 벤치마크에서 글로벌 모델 우회하는 성능 기록 성과

카카오, 자체개발 옴니AI모델 ‘Kanana-o’ 음성 생성기술 성능 비교 이미지. 사진=카카오
카카오, 자체개발 옴니AI모델 ‘Kanana-o’ 음성 생성기술 성능 비교 이미지. 사진=카카오
[빅데이터뉴스 김유승 기자] 카카오가 사용자가 요구하는 속도·음량·음높이·감정·억양 등을 조절할 수 있는 음성 생성 기술을 개발했다.

카카오는 자체 개발 옴니 AI 모델 'Kanana-o(카나나-오)'의 음성 생성 기술을 이용자가 세밀하게 제어할 수 있도록 고도화했다고 4일 밝혔다. 기존 음성 AI가 텍스트를 자연스럽게 읽는 데 집중했다면, 개선된 Kanana-o는 "슬픈 목소리로 읽어줘", "아나운서처럼 읽어줘" 등 사용자의 발화 지시에 맞춰 속도·음량·음높이·감정·억양까지 조절할 수 있다. 한국어뿐 아니라 영어 음성 생성에서도 동일한 제어가 가능하다.
이용자가 자연어로 원하는 말투와 감정, 억양 등을 입력하면 AI가 이를 반영해 음성을 생성한다. 이와 함께 자체 개발 음성 토크나이저 'LM-SPT'를 적용해 음성 생성 속도와 효율도 높였다.

Kanana-o는 음성 생성 지시 이행 능력을 평가하는 'InstructTTSEval' 한국어 벤치마크에서 94.50점을 기록해 GPT-4o-mini-tts(91.10점)를 넘어섰다. 카카오는 향후 음성 이해와 생성 기술을 통합하고 웃음·한숨 등 비언어적 표현까지 구현하는 등 음성 AI 기술을 지속 고도화할 계획이다.

앞서 카카오는 허깅페이스에 스마트폰 등 온디바이스 환경에서 구동 가능한 경량 언어모델(SLM) 'Kanana-2' 4종을 오픈소스로 공개하기도 했다. 한국어 특화 토크나이저를 적용해 처리 효율을 높였으며, 상업적 활용이 가능한 라이선스로 배포해 국내 AI 생태계 확대에 나선다는 계획이다. 이와 함께 카카오는 지난달 30일 AI 윤리 거버넌스 강화를 위해 'AI&기술윤리소위원회' 외부 전문 자문단을 발족하는 등 윤리 거버넌스 강화에도 힘쓰고 있다.

한편, 카카오는 오는 10월 10일 경기도 성남시 탄천 일대에서 1만 명 규모의 러닝 페스티벌 '카카오프렌즈 런 2026'을 개최한다. 이번 행사는 카카오프렌즈 IP와 카카오맵, 카카오톡 지갑, 카카오같이가치 등 다양한 서비스를 연계한 온·오프라인 러닝 축제로, 5km와 10km 코스로 운영된다. 참가자에게는 러닝 의류 세트와 완주 메달 등이 제공되며, AI 러닝 코칭 등 카카오 기술을 활용한 체험 프로그램도 마련된다.
김유승 빅데이터뉴스 기자 kys@thebigdata.co.kr
리스트바로가기

헤드라인

빅데이터 라이프

재계뉴스

상단으로 이동