Qwen3-ASR × BibiGPT

2026년 1월 30일, 알리바바 클라우드의 Qwen 팀이 Qwen3-ASR을 오픈소스로 공개했습니다. 52개 언어·방언을 다루는 음성 인식 모델 계열로 1.7B와 0.6B 두 가지 크기가 있고, 11개 언어에서 텍스트와 음성을 맞춰 주는 비자기회귀 강제 정렬 모델도 함께 제공됩니다. 1.7B는 오픈소스 음성 인식 중 최고 수준으로 최상급 상용 API와 견줄 만하고, 0.6B는 정확도를 조금 양보하는 대신 동시 실행 128에서 약 2000배 처리량에 도달합니다. 실질적인 의미는 이렇습니다. 방언이 강하거나 억양이 뚜렷하거나 음악이 깔린 오디오를 정확히 전사하는 일이 더 이상 유료 API만의 영역이 아니게 됐습니다. 다만 글자를 뽑는 건 절반일 뿐이고, 나머지 절반—타임스탬프가 붙은 스크립트, 요약, 검색 가능한 노트—은 링크 하나로 BibiGPT가 처리합니다.

오픈소스 · 2026-01-30 52개 언어·방언 1.7B / 0.6B
BibiGPT을 Google 선호 소스로 추가 주요 뉴스와 AI 답변에서 BibiGPT를 더 자주 만나보세요.

핵심 사실 (90초 요약)

2026년 1월 30일 알리바바 클라우드 Qwen 팀이 Qwen3-ASR을 오픈소스로 공개했습니다. 1.7B와 0.6B 두 크기의 음성 인식 모델로 52개 언어·방언(30개 언어와 중국어 22개 방언, 억양 있는 영어 포함)을 다루고 언어 감지와 타임스탬프 예측을 내장하며, 11개 언어용 비자기회귀 강제 정렬 모델도 함께 제공됩니다. 1.7B는 오픈소스 음성 인식 중 최고 수준으로 최상급 상용 API와 견줄 만하고, 0.6B는 동시 실행 128에서 약 2000배 처리량에 도달합니다. 실무적 결론은 이렇습니다. 방언·억양·음악이 섞인 오디오의 정확한 전사가 더 이상 유료 API만의 것이 아닙니다. 글자를 뽑는 건 쉬운 절반이고, 나머지 절반—링크 하나를 타임스탬프 스크립트와 요약, 검색 가능한 노트로 바꾸는 일—은 BibiGPT가 맡습니다.

Features

Qwen3-ASR이란?

2026-01-30 알리바바 클라우드 Qwen 팀이 오픈소스로 공개한 올인원 음성 인식 모델 계열입니다. Qwen3-ASR-1.7B와 Qwen3-ASR-0.6B 두 크기가 있으며, 둘 다 52개 언어·방언 범위에서 언어 식별과 전사를 수행하고 타임스탬프 예측을 내장합니다. 별도로 기존 텍스트와 음성을 11개 언어에서 맞춰 주는 비자기회귀 강제 정렬 모델도 제공됩니다.

52개 언어와 방언

30개 언어에 더해 중국어 22개 방언, 그리고 여러 국가·지역 억양의 영어까지 다룹니다. 방언과 억양은 대부분의 오픈소스 음성 인식이 무너지는 지점이고, 실제 녹음은 대개 그렇게 들립니다.

두 가지 크기, 두 가지 선택

1.7B는 오픈소스 음성 인식 중 최고 수준이며 최상급 상용 API와 경쟁합니다. 0.6B는 정확도를 지키면서 동시 실행 128에서 약 2000배 처리량에 도달합니다. 한 파일을 완벽하게가 아니라, 대량 처리를 위한 선택입니다.

말·음악·노래, 게다가 타임스탬프

말소리뿐 아니라 음악과 노래도 처리하고, 언어를 스스로 판별하며 타임스탬프를 예측합니다. 타임스탬프가 있느냐 없느냐가 글자 벽과 건너뛰며 볼 수 있는 스크립트를 가릅니다.

영상을 다룬다면 오픈소스 음성 인식 공개를 눈여겨봐야 하는 이유

스크립트는 그 뒤 모든 작업의 원재료입니다. 요약, 검색, 번역, 클립, 노트가 전부 여기서 시작합니다. 정확한 다국어 전사가 오픈되고 저렴해지면 병목은 '글자를 얻는 일'에서 '글자로 무엇을 하는가'로 옮겨갑니다. 그 후반부가 BibiGPT의 자리입니다.

방언이 강한 오디오가 더 이상 막다른 길이 아닙니다

지역 방언이 섞인 녹음이나 억양이 강한 영어는 오랫동안 '전사하면 못 쓰게 나오는' 파일이었습니다. 오픈 모델이 방언과 억양을 품으면서, 애초에 무엇을 전사할 가치가 있는지가 달라집니다.

스크립트는 첫 단계일 뿐입니다

어떤 음성 인식이 뱉은 원문이든 결국 사람이 읽어야 합니다. BibiGPT는 링크 하나로 타임스탬프가 붙은 스크립트에 더해 AI 요약, 마인드맵, 노트까지 돌려줍니다. 두 시간짜리 녹음이 몇 분이면 훑을 수 있는 형태가 됩니다.

답만 필요한 사람에게 환경 구성은 필요 없습니다

오픈 모델을 돌리려면 가중치와 GPU, 그리고 돌리기 위한 환경 일체가 필요합니다. 수업 하나를 따라잡고 싶은 사람은 그 어느 것도 만지고 싶지 않습니다. BibiGPT는 브라우저에 링크를 붙여넣는 수준으로 되돌립니다. 결과는 같고 조립이 없습니다.

핵심 사실 5가지 (90초 요약)

Qwen 팀의 2026-01-30 Qwen3-ASR 오픈소스 공개에서 나온 주요 사실입니다.

  1. 1

    2026-01-30 오픈소스 공개

    알리바바 클라우드 Qwen 팀은 Qwen3-ASR을 API 전용 제품이 아니라 오픈소스 모델 계열로 공개했습니다.

  2. 2

    52개 언어와 방언

    30개 언어에 중국어 22개 방언, 그리고 여러 국가·지역 억양의 영어까지. 대부분의 오픈소스 음성 인식에 없던 커버리지입니다.

  3. 3

    두 가지 크기: 1.7B와 0.6B

    1.7B는 오픈소스 음성 인식 벤치마크를 이끌고 최상급 상용 API에도 통합니다. 0.6B는 정확도를 조금 양보하는 대신 동시 실행 128에서 약 2000배 처리량을 얻습니다.

  4. 4

    언어 감지와 타임스탬프 내장

    모델이 스스로 어떤 언어인지 판별하고 타임스탬프를 예측하며, 깨끗한 말소리뿐 아니라 음악과 노래도 다룹니다.

  5. 5

    11개 언어 전용 정렬 모델

    비자기회귀 강제 정렬 모델이 11개 언어에서 기존 텍스트와 음성을 맞춰 줍니다. 자막 제작과 가사 타이밍에 필요한 바로 그 조각입니다.

BibiGPT 사용자의 대표 시나리오 3가지

넓고 정확한 음성 인식이 '무엇을 전사할 가치가 있는가'를 어떻게 바꾸는지.

방언이 섞인 강의

교수가 표준어와 지역 방언을 오가는 수업을 학생이 녹음합니다. 구멍투성이 스크립트 대신 읽을 수 있는 타임스탬프 텍스트와 요약이 돌아오고, 복습은 다시 듣기가 아니라 노트에서 시작합니다.

다국어 팟캐스트 아카이브

여러 나라 출신에 억양도 제각각인 게스트와 함께한 몇 년치 에피소드가 있습니다. 링크마다 검색 가능한 스크립트와 구조화된 요약이 되어, 아무도 뒤지지 못하던 아카이브가 다시 쓸 만한 소재가 됩니다.

오디오와 딱 맞는 자막

편집자에게 대본과 완성본은 있지만 타이밍이 없습니다. 자막을 정확한 프레임에 얹는 건 타임스탬프 전사입니다. BibiGPT는 같은 소스에서 이중 언어 자막까지 한 번에 만들어 줍니다.

크리에이터, 학생, 연구자들이 애용합니다

매일 영상을 텍스트로 바꾸는 데 BibiGPT가 선택받는 이유.

전 세계 50,000명 이상이 신뢰하는 서비스

★★★★★

“링크만 붙여넣으면 몇 초 만에 깔끔한 자막 텍스트가 나와서 매주 몇 시간씩 걸리던 받아쓰기가 사라졌어요.”

Maya R.

콘텐츠 크리에이터 · 숏폼 영상 재활용

★★★★★

“스크립트를 내보낼 수 있어서 영상을 계속 멈추지 않고 제 속도로 새 단어를 복습할 수 있습니다.”

Daniel K.

어학 학습자 · 실제 영상으로 공부

★★★★★

“타임스탬프가 달린 정확한 텍스트를 바로 인용할 수 있어요. 어느새 매일 쓰는 워크플로의 일부가 됐습니다.”

Priya S.

연구원 · 공개 강연 인용

자주 묻는 질문

무엇이든 물어보세요!

인기 가이드

어떤 영상이나 팟캐스트든 검색 가능한 스크립트로

빌리빌리·YouTube·팟캐스트 링크를 붙여넣거나 직접 파일을 올리세요. BibiGPT가 타임스탬프 스크립트와 영상 요약 ai 결과, 그리고 검색·번역해서 노트 앱으로 보낼 수 있는 메모를 만들어 줍니다. 모델 설정도 GPU도 커맨드라인도 필요 없습니다.