WorkBuddy란: 로컬 AI 오피스 에이전트(2026)
트렌드

WorkBuddy란: 로컬 AI 오피스 에이전트(2026)

게시일 · 작성자: BibiGPT 팀
BibiGPT을 Google 선호 소스로 추가 주요 뉴스와 AI 답변에서 BibiGPT를 더 자주 만나보세요.

노트북을 열면 오늘 아침 회의 녹음, 퇴근 전에 내야 하는 주간 보고, 상사가 던진 「이거 PPT로 정리해」가 쌓여 있습니다. 예전에는 하나씩 손으로 했습니다. 이제 그 흐름을 한 번에 끝내 준다고 하는 새 도구가 나왔습니다. 텐센트가 2026년 3월에 내놓은 WorkBuddy가 그중 하나입니다.

이것은 「또 하나의 AI 어시스턴트」가 아닙니다. AI가 일상 오피스 업무를 실제로 넘겨받을 수 있는가에 대한 신호입니다. 안타깝게도 대부분의 소개 글은 보도자료를 그대로 나열하고 끝납니다. 쓰는 법도, 오늘 아직 못 하는 일도 말하지 않습니다. 이 가이드는 둘 다 채웁니다.

WorkBuddy란: 30초 만에 보는 로컬 오피스 에이전트

WorkBuddy는 텐센트 CodeBuddy 체계의 AI 오피스 에이전트입니다. 2026년 3월 9일 출시되었고, 핵심은 「로컬 실행」입니다. 내 컴퓨터에서 돌며 PPT 만들기, 보고서 쓰기 같은 다단계 일을 스스로 계획하고 납품하며, 여러 에이전트를 동시에 돌릴 수 있습니다. 공식 입구는 텐센트 WorkBuddy 공식 페이지입니다.

질문-답변만 하는 챗봇과 달리, 에이전트의 특징은 「목표를 주면 단계를 나누고 도구를 호출해 완성물을 손에 쥐여 준다」는 점입니다. WorkBuddy는 텐센트의 CodeBuddy 제품군에서 왔고, 개발자용이던 에이전트 능력을 일반 오피스로 옮겼습니다.

먼저 떠도는 오해를 고칩니다. WorkBuddy는 「텐센트 위안바오를 대체하는 핵심」이 아닙니다. 2026년 중반 기준 텐센트는 여러 제품이 병렬입니다. 혼원(Hunyuan)이 기반 모델, 위안바오가 개인 대화 입구, CodeBuddy가 개발자, WorkBuddy가 오피스, 그리고 QClaw와 Marvis 등. WorkBuddy는 그 판에서 「오피스 실무를 하는」 말입니다.

실용 규칙: AI 에이전트가 일을 넘겨받을 수 있는지를 보려면, PPT를 쓸 수 있는지가 아니라 먼저 당신이 쓰는 입력 형식을 읽을 수 있는지를 물으세요.

WorkBuddy 사용법: 5개 모델 전환, 스킬 팩, 기업 연결

사용법은 세 가지 능력으로 나뉩니다. 이 셋을 이해하면 워크플로의 어디에 둘지가 보입니다.

첫째, 여러 모델을 자유롭게 전환. 텐센트 공식 페이지에 따르면 WorkBuddy는 혼원, DeepSeek, GLM, Kimi, MiniMax 다섯 모델을 전환할 수 있습니다. 코드에 가까운 일은 추론이 강한 쪽, 카피에 가까운 일은 문장이 능한 쪽, 같은 도구 안에서 일감에 맞춰 엔진을 고릅니다.

둘째, 내장 스킬과 기업 연결. WorkBuddy에는 20개 넘는 「스킬 팩」이 들어 코드 한 줄 없이 능력을 더할 수 있습니다. 동시에 WeCom(기업 위챗), QQ, Lark(페이슈), DingTalk에 직접 붙어, 에이전트 산출물을 평소 쓰는 협업 도구로 되돌립니다. 기업 사용자에게는 보안 감사도 있습니다.

셋째, 로컬 실행과 다중 에이전트 병렬. 작업은 내 기기에서 돕니다. 여러 에이전트가 서로 다른 하위 작업을 동시에 밀 수 있습니다. 하나는 자료 조사, 하나는 개요 정리, 하나는 조판, 마지막에 보고서나 PPT로 모읍니다.

능력WorkBuddy의 방식당신에게 의미
모델혼원/DeepSeek/GLM/Kimi/MiniMax 전환일 종류에 맞는 「두뇌」를 고름
확장20+ 내장 스킬 팩, 코드 불필요개발을 몰라도 능력을 더함
연결WeCom/QQ/Lark/DingTalk 직결산출물이 일상 도구로 돌아옴
실행로컬, 다중 에이전트 병렬데이터가 기기를 안 떠나고 더 빠름
장면PPT·보고서 자동 작성반복 문서 생산을 넘겨받음

WorkBuddy가 해 주는 일, 그리고 막히는 지점

위 능력을 실제 사람에게 대면 가치와 경계가 동시에 드러납니다.

직장인에게 가장 직접적인 가치는 「재료 더미를 제출 가능한 문서로 만드는」 일의 자동화입니다. 주간 보고, 경쟁사 분석, 회의록 재가공. 운영과 프로덕트라면 기업 도구에 흩어진 정보를 초안으로 끌어올 수 있습니다. 창업자와 소규모 팀이라면 한 사람이 어시스턴트 반 명을 커버합니다.

다만 이 세대 오피스 에이전트에 거의 공통인 사각이 있습니다. 기본 입력은 글자입니다. 두 시간짜리 회의 녹화, 업계 팟캐스트, 경쟁사 발표 라이브, 온라인 강의—에이전트는 읽지 못합니다. 이미 글인 자료를 PPT로 만들 수는 있어도, 「먼저 그 두 시간 영상을 보고 나서 착수」하지는 못합니다.

먼저 영상을 보게 하려면 자막 검색이 필수 한 걸음입니다. 말한 문장 하나하나를 검색 가능한 글자로 바꿉니다.

아래 그림과 대조하면 더 직관적입니다.

BibiGPT 딥 서치에서 영상 자막 전문을 바로 검색해 핵심 정보를 빠르게 찾음

스크린샷: BibiGPT · 딥 서치 기능 데모

직장 정보에서 음성·영상은 큰 덩어리입니다. 회의는 녹화 재생, 업계 동향은 팟캐스트와 라이브, 학습은 온라인 강의. 들어오는 입구의 절반 이상은 「듣고 보기」인데, 에이전트는 「읽기」만 압니다.

실용 규칙: AI에게 읽지 못하는 형식을 읽히지 마세요. 먼저 음성·영상을 글자로 바꾼 뒤, 어떤 에이전트에든 넣으세요.

WorkBuddy에 「영상 보기」 손을 붙이기: BibiGPT와의 실전 조합

WorkBuddy가 막히는 그 한 걸음—「음성·영상을 넣을 수 있는 글자로 바꾸기」—은 BibiGPT 같은 AI 음성·영상 어시스턴트가 하는 일입니다. 경쟁이 아닙니다. 앞뒤입니다. BibiGPT가 「듣고 보기」를 구조화 텍스트로 바꾸고, WorkBuddy가 그 글을 들고 PPT와 보고서를 이어 갑니다. 2026년 7월 기준 BibiGPT는 100만 명 넘는 사용자를 서비스했고, 누적 500만 회가 넘는 AI 요약을 생성했으며, 30개 넘는 주요 음성·영상 플랫폼을 지원합니다.

오늘 바로 쓸 수 있는 조합은 다음과 같습니다.

1단계. 음성·영상을 쓸 수 있는 요점 텍스트로 바꿉니다. YouTube나 Bilibili 링크를 붙이거나 로컬 녹화를 올립니다. BibiGPT가 자막을 추출하고 구조화 요약을 만듭니다. 같은 동작으로 영상을 그림이 있는 글로도 바꿀 수 있어, 「제출할 문서가 필요」한 수요에 바로 이어집니다. AI 영상 → 그림 글을 참고하세요.

입구는 여기입니다. 링크 하나면 산출물이 나옵니다.

BibiGPT 영상 → 글: 영상 링크를 붙여 구조화 그림 글을 한 번에 생성

스크린샷: BibiGPT · 영상 → 글 기능 데모

2단계. 여러 편을 한 번에 묶습니다. 정리할 것이 시리즈 전체라면—강의 10편, 한 분기의 업계 공유 여러 편—무료 영상 일괄 요약으로 전체 개관과 마인드맵을 만들고, 하나씩 보지 않아도 됩니다.

아래 그림이 컬렉션 요약 입구입니다.

BibiGPT 컬렉션 요약 입구: 영상 시리즈 전체를 한 번에 개관으로

스크린샷: BibiGPT · 컬렉션 요약 기능 데모

3단계. 결론을 되묻고, 출처를 확보합니다. 요약을 받은 뒤에는 보통 「이 숫자는 어느 구간에서 나왔나」를 확인하고 싶습니다. BibiGPT의 출처가 있는 YouTube 영상 요약은 각 답에 클릭 가능한 타임스탬프와 원본 클립을 붙여, AI가 그냥 말하지 못하게 합니다.

실사입니다. 모든 답이 원본 영상의 그 순간으로 돌아갑니다.

BibiGPT AI 영상 대화와 출처 추적: 답에 클릭 가능한 타임스탬프와 원본 클립

스크린샷: BibiGPT · AI 영상 대화와 출처 추적 데모

실용 규칙: 먼저 요약한 뒤 볼지를 결정하세요. 2시간 시청 대신 5분 요약으로 시간을 쓸지 투자 결정을 하세요.

4단계. 정리된 글을 에이전트에 넘깁니다. 영상 화면 내용 분석으로 요점을 캐물은 뒤, Obsidian 노트로 보내기로 Notion, Obsidian, Readwise에 한 번에 보내거나 Markdown/PDF로 받습니다. 이 깨끗한 글이 WorkBuddy에 넘겨 PPT와 보고서를 이어 가게 할 원료입니다.

아래 그림이 대화 추질문 입구입니다.

BibiGPT AI 대화 추질문: 영상 내용에 대한 깊은 질문과 비판적 사고

스크린샷: BibiGPT · AI 대화 추질문 기능 데모

어떤 문장이 어디서 나왔는지 찾을 때는 영상 내용 검색이 제목과 요약이 아니라 자막 전문을 검색합니다. 「BibiGPT가 음성·영상을 글로 → WorkBuddy가 그 글로 산출물」 이 릴레이가, 에이전트가 정보 입구 전부를 덮는 닫힌 고리입니다.

우리의 판단: 오피스 에이전트의 다음 전장은 멀티모달 입력

나중에 검증할 수 있는 판단을 적습니다.

판단 1. 멀티모달 입력이 오피스 에이전트의 다음 주 전장이 됩니다. 이 세대 작업대(WorkBuddy, TRAE Work 등)는 「누구의 에이전트가 더 잘 계획하고 도구를 부르는가」를 겨룹니다. 진짜 앞단 병목은 입력입니다. 음성·영상이 못 들어옵니다. 겁니다. 2027년 6월 전에 주류 오피스 에이전트가 음성·영상을 네이티브로 읽지 못하면, 그 자리를 먼저 메운 쪽이 회의·강의·팟캐스트 세 고빈도 장면을 가져갑니다. 기한이 되면 답을 맞춥니다.

판단 2. 단기에는 에이전트가 쓸 만한 음성·영상 이해를 스스로 키우지 않습니다. 음성·영상을 안정적이고 품질 좋은 쓸 수 있는 글로 바꾸는 일은 전문 일입니다. 자막 추출, 화자 분리, 크로스 플랫폼 대응. 앞으로 12개월, 오피스 에이전트는 자체 개발보다 외부 음성·영상 변환 층을 붙여 메울 가능성이 크다고 봅니다. 이 판단은 우리가 음성·영상 도구를 만드는 입장과 겹칩니다. 그 이해관계를 알고 읽으세요.

판단 3. 「먼저 요약한 뒤 볼지를 결정」이 「보고 나서 정리」를 대체합니다. 에이전트가 몇 초 만에 영상 요점을 내주면, 사람의 행동은 거꾸로 갑니다. 먼저 물건을 확인하고, 시간을 쓸지를 결정합니다. 「시청 결정의 문지기」로 자신을 놓은 쪽이 올바른 서사 편에 섭니다.

자주 묻는 질문(FAQ)

Q1: WorkBuddy와 텐센트 위안바오는 어떤 관계인가요? 병렬인 다른 제품입니다. 위안바오는 개인 대화 입구, WorkBuddy는 CodeBuddy 체계에서 나온 오피스 실행형 에이전트입니다. WorkBuddy는 「위안바오를 대체」하지 않습니다.

Q2: WorkBuddy는 어떤 대규모 모델을 지원하나요? 텐센트 공식 페이지에 따르면 혼원, DeepSeek, GLM, Kimi, MiniMax 다섯을 자유롭게 전환하고, 일 종류에 따라 고릅니다.

Q3: WorkBuddy는 회의 녹화나 팟캐스트를 읽나요? 2026년 7월 기준 이 세대 오피스 에이전트의 기본 입력은 글자이고, 음성·영상은 직접 대상이 아닙니다. 먼저 BibiGPT로 구조화 텍스트로 바꾼 뒤 WorkBuddy에 넘기면 됩니다.

Q4: 로컬 실행이 무엇이고, 데이터는 안전한가요? 로컬 실행은 작업이 내 컴퓨터에서 돈다는 뜻입니다. 외부로 올리지 않고도 처리할 수 있고, 기업 사용자에게는 보안 감사도 있어 상대적으로 통제하기 쉽습니다.

Q5: 프로그래머가 아닌데 WorkBuddy를 쓸 수 있나요? 됩니다. 20개 넘는 스킬 팩이 들어 있고, 제로코드 확장이 핵심입니다. PPT·보고서 같은 오피스 일은 비개발자를 향한 것입니다.


음성·영상은 AI 시대 정보 입력에서 가장 큰 「암흑물질」입니다. 에이전트는 읽지 못하고, 당신은 손에서 놓을 수 없습니다. 먼저 글자로 바꾸면, 이미 쓰는 AI 도구가 비로소 돌아가기 시작합니다.

BibiGPT를 열고 회의 녹화와 온라인 강의를 쓸 수 있는 글로 바꾸기

BibiGPT 팀

'도구 비교와 선택' 글 54편 모두 보기 →

이 AI 도구를 사용해 보세요