반응형 전체 글233 Redis가 LLM(대형 언어 모델) 비용을 최대 70~90%까지 절감할 수 있는 핵심 이유 Redis가 LLM(대형 언어 모델) 비용을 최대 70~90%까지 절감할 수 있는 핵심 이유는 '시맨틱 캐싱(Semantic Caching)' 기술을 활용하기 때문입니다. 실무 프로덕션 환경의 LLM 앱(챗봇, 사내 어시스턴트 등)에서는 사용자들이 의미가 완전히 같은 질문을 표현만 다르게 해서 반복적으로 묻는 경우가 많습니다. 예를 들어 아래와 같은 질문들이 있습니다. "API 키를 재발급받는 방법이 뭐야?""API 키를 교체하려면 어디로 가야 해?"문장은 다르지만 답변은 동일한 질문들입니다. Redis는 이러한 중복 비용 문제를 다음과 같은 방식으로 해결합니다. 1. 일반 캐시나 프리픽스 캐시(Prefix Caching)와의 차이점기존 캐시 / 프리픽스 캐시: 글자나 토큰이 비트 단위(bit-by-bi.. 2026. 9. 26. "PDF 통째로 넣으면 망합니다?" 비용과 정확도 모두 잡는 나만의 AI 지식 베이스 만들기 우리가 흔히 하는 착각 중 하나가 있습니다.> "AI야, 이 문서 통째로 읽고 내 지식 베이스 만들어줘!"> 하지만 막상 문서를 통째로 넣고 대답을 시켜보면 소수점이 엉뚱하게 바뀌어 있거나(1.8이 18로 변신!), 그림 속 화살표 방향을 까먹는 등 엉터리 답변을 내놓기 일쑤입니다.AI 지식 베이스 구축의 핵심은 검색보다 '제대로 읽기(파싱)'에 있습니다. 매번 무거운 PDF를 통째로 읽힐 수는 없으니, 미리 알맹이만 쏙쏙 글자로 꺼내두는 똑똑한 전략이 필요합니다.실험을 통해 알아낸 가장 저렴하고 정확한 문서 파싱 노하우, 쉽게 정리해 드릴게요!🔍 1. 문서를 쪼개서 보니 생기는 일 (영역별 특징)문서 한 장 안에는 글자, 표, 그림, 스캔 사진이 뒤섞여 있죠? AI와 파서들에게 각각 한 장씩 주고 테.. 2026. 9. 24. AI 시대의 역설: "신입이 AI를 더 잘 쓰면, 정말로 시니어를 뛰어넘을 수 있을까?" 최근 MIT와 구글이 특허 전문 변호사 133명을 대상으로 진행한 3개월 간의 흥미로운 실험 결과가 화제입니다. 이 실험은 AI 시대의 일하는 방식과 성장에 대해 매우 날카로운 화두를 던졌습니다. 실험 내용과 이에 대한 흥미로운 반론, 그리고 우리가 시사점으로 얻어야 할 결론을 블로그 글 형식으로 정리해 보았습니다. 원문 연구 내용에 대한 자세한 사항은 NBER 논문 원문에서 확인하실 수 있습니다. 실험이 던진 충격: "AI를 가장 잘 쓴 사람이, 가장 적게 배웠다"실험은 미국 특허 전문 로펌에서 변호사를 무작위로 나누어 한쪽에만 AI 작성 도구를 제공하고 3개월간 진행되었습니다. AI를 켜둔 3개월 동안: 예상대로 생산성은 폭발적으로 증가했습니다. 특히 경력이 짧은 변호사들의 업무 처리 속도와 결과물 .. 2026. 9. 20. "AI 못 다루면 혁신도 없다"… 말로만 외치던 AI, 기업들은 어떻게 행동으로 옮기고 있을까? 사무실 책상마다 인공지능(AI)이 비서처럼 일하는 시대가 왔지만, 막상 "우리 회사 업무에 AI를 어떻게 쓰지?"라고 물으면 막막해하는 직장인들이 여전히 많습니다. 기술은 쏟아지는데 현업에서 체감하는 속도는 더디기만 합니다.이러한 갈증을 해소하려고 기업들은 단순한 'AI 도입'을 넘어 임직원들의 '체질 개선'으로 판을 키우고 있습니다. 최근 한국석유공사의 행보는 AI 시대에 기업들이 무엇을 강조하는지 보여주는 사례입니다. 공기업에 들어선 AI 실습실, 'AI 랩(Lab)'의 비밀한국석유공사는 울산 본사에 전용 교육관 'AI 랩'을 열고 전사적 역량 강화를 선언했습니다. 눈에 띄는 점은 교육 대상이 일부 IT 개발자가 아니라 경영진부터 신입사원까지 전 직원이라는 사실입니다.여기서 주목할 것은 교육의 방식입.. 2026. 9. 11. AI와 도구를 잇는 표준, MCP v2 핵심 요약: 무엇이 달라졌을까요? 안녕하세요! AI 에이전트와 외부 서비스(DB, API 등)를 연결해 주는 표준 프로토콜인 MCP(Model Context Protocol)가 대규모 개편을 거쳐 v2로 새롭게 태어났습니다.이번 v2 업그레이드는 단순한 기능 추가를 넘어, "AI 인프라를 웹 표준에 맞게 얼마나 가볍고 확장성 있게 만들 것인가"에 초점을 맞추어 근본적인 구조가 대수술되었습니다.기존 v1과 비교해 어떤 점이 명확하게 바뀌었는지 블로그 형식으로 알기 쉽게 정리해 드립니다!1. 가장 큰 변화: "세션이 필요 없는" 무상태(Stateless) 구조기존(v1): 클라이언트와 서버가 연결될 때 핸드셰이크(initialize) 과정을 거치고, 세션 ID(Mcp-Session-Id)를 유지한 상태에서 통신해야 했습니다. 이 때문에 서버.. 2026. 8. 20. 복잡한 AI 에이전트 워크플로우의 정답: '그래프 엔지니어링(Graph Engineering)'과 오르카(Orca) 실전 가이드 최근 AI 에이전트 개발 환경에서 '그래프 엔지니어링(Graph Engineering)'이 화두입니다. 단일 루프 방식의 한계를 넘어, 여러 에이전트가 협업하는 구조를 체계적으로 설계하는 방법론입니다.오늘은 그래프 엔지니어링의 핵심 개념과 함께, 이를 실제로 구현하기 위한 오르카(Orca) 오케스트레이션 활용법 및 실제 프롬프트 예시를 정리해 드립니다.1. 그래프 엔지니어링이란? (루프 vs 그래프)루프 엔지니어링(Loop Engineering): 하나의 에이전트가 트리거 발생 후 '계획-실행-검토' 과정을 종료 조건이 충족될 때까지 반복하는 방식입니다.그래프 엔지니어링(Graph Engineering): 하나의 루프로 해결하기 어려운 복잡한 작업을 다수의 특화된 에이전트(노드)로 분산하고, 이들 간의 .. 2026. 8. 19. 이전 1 2 3 4 ··· 39 다음 반응형