O LiveKit é uma plataforma líder de tempo real que permite a desenvolvedores adicionar recursos de vídeo, voz e dados às suas aplicações. Fundado em 2021 como projeto de código aberto baseado em WebRTC, o LiveKit é pioneiro em IA de voz e vídeo em tempo real. Hoje, milhares de desenvolvedores e equipes dependem de sua infraestrutura, de desenvolvedores individuais a grandes empresas que ampliam os limites da voz em tempo real, como a OpenAI.
Enquanto a maioria das empresas via chamadas de vídeo apenas como ferramenta para reuniões online, os fundadores do LiveKit imaginavam um futuro em que voz e vídeo em tempo real seriam essenciais a qualquer aplicação. Essa visão culminou no lançamento do LiveKit Agents em janeiro de 2024, um framework inovador para criar agentes de IA multimodais e programáveis.
Experimente uma conversa ao vivo com um agente do LiveKit que usa a Cartesia:
O desafio
O LiveKit decidiu criar agentes de IA com capacidade de raciocínio de nível humano, o que exigia soluções para vários desafios técnicos complexos:
- Baixa latência: para raciocinar em tempo real, os agentes precisavam de processamento extremamente responsivo, com tempos de resposta humanos. Como o LiveKit orquestra diversas modalidades de IA, como vídeo e texto além de áudio, precisa transportar dados entre servidor e cliente o mais rápido possível.
- Vozes naturais: os agentes do LiveKit frequentemente substituem pessoas em interações como chamadas telefônicas, então a fala precisa soar extremamente realista.
- Suporte multilíngue: os agentes precisavam operar de forma fluida em vários idiomas, já que os clientes do LiveKit estão distribuídos pelo mundo.
- Escalabilidade: aplicações críticas, como agentes de voz para despacho de emergências do 911, exigiam suporte a muitos usuários simultâneos com disponibilidade e desempenho garantidos nos picos de uso.
- Limitações da janela de contexto: agentes de longa duração do LiveKit precisam manter conversas e contexto coerentes enquanto processam fluxos multimodais de áudio, vídeo e texto em tempo real. Modelos Transformer tinham dificuldades, exigindo recarga constante do contexto e enfrentando limites rígidos no comprimento das sequências que tornavam impossível a interação contínua.
A solução
O LiveKit escolheu a Cartesia porque o Sonic, construído sobre modelos de espaço de estados, uma arquitetura fundamentalmente nova para IA, se alinhava perfeitamente à sua visão para a próxima geração de agentes de IA.
- Arquitetura avançada: SSMs permitem que o Sonic mantenha estado e processe dados em streaming nativamente, possibilitando que agentes preservem contexto por horas ou dias de interação sem perda de desempenho.
- Latência ultrabaixa: a Cartesia oferecia o modelo de menor latência do mercado, com menos de 100 ms até o primeiro áudio, permitindo que agentes multimodais do LiveKit alcançassem consistentemente desempenho superior de ponta a ponta.
- Geração natural de voz: os modelos da Cartesia produzem fala semelhante à humana, sensível ao contexto e consistente ao longo de conversas extensas.
- Suporte multilíngue: a Cartesia oferece 14 idiomas com a mesma latência, qualidade e precisão líderes do setor de seu modelo em inglês.
- Escalabilidade empresarial: infraestrutura sólida para aplicações críticas de grande volume.
Os resultados
A Cartesia está disponível como uma integração para o LiveKit Agents. A parceria permitiu que o LiveKit implantasse agentes em aplicações diversas e exigentes, incluindo:
- Serviços de emergência: agentes de IA de voz para despacho de emergências do 911, que exigem confiabilidade perfeita e interação natural.
- Jogos: NPCs de IA que oferecem experiências imersivas.
- Veículos autônomos: processamento de telemetria e tomada de decisões em tempo real.
- Soluções empresariais: integração fluida de recursos de voz e imagem com sistemas de IA existentes.
Para desenvolvedores
A vantagem de usar LiveKit e Cartesia juntos é obter a qualidade da rede global WebRTC do LiveKit com a velocidade do modelo de texto para fala Sonic da Cartesia.
Desenvolvedores podem executar os workers do Agents nos próprios laptops durante o desenvolvimento e implantá-los em seus servidores para produção. Os agentes se conectam diretamente à API da Cartesia e usam a rede LiveKit para transmitir áudio aos usuários.
O resultado é um sistema em que desenvolvedores têm um modelo de texto para fala de ponta para seu agente de voz e mantêm controle sobre a lógica de negócio, como RAG ou consultas a dados, no próprio código. A prova de conceito mais simples de um agente de voz tem apenas cinquenta linhas, sem contar espaços e comentários. O exemplo original em inglês foi preservado:
load_dotenv(dotenv_path=".env.local")
logger = logging.getLogger("voice-agent")
def prewarm(proc: JobProcess):
proc.userdata["vad"] = silero.VAD.load()
async def entrypoint(ctx: JobContext):
initial_chat_context = llm.ChatContext().append(
role="system",
text=(
"You are a voice assistant created by LiveKit. Your interface with users will be voice. "
"You should use short and concise responses, and avoid usage of unpronounceable punctuation. "
),
)
logger.info(f"connecting to room {ctx.room.name}")
await ctx.connect(auto_subscribe=AutoSubscribe.AUDIO_ONLY)
# Wait for the first participant to connect
participant = await ctx.wait_for_participant()
logger.info(f"starting voice assistant for participant {participant.identity}")
# Set up the Agent
agent = VoicePipelineAgent(
vad=ctx.proc.userdata["vad"],
stt=deepgram.STT(),
llm=openai.LLM(model="gpt-4o-mini"),
tts=cartesia.TTS(
model="sonic",
voice="794f9389-aac1-45b6-b726-9d9369183238",
),
chat_ctx=initial_chat_context,
)
agent.start(ctx.room, participant)
# Once connected, we start by hardcoding a greeting
await agent.say(f"Hey {participant.identity}! How can I help you today?", allow_interruptions=True)
if __name__ == "__main__":
cli.run_app(
WorkerOptions(
entrypoint_fnc=entrypoint,
prewarm_fnc=prewarm,
),
)
As aplicações de internet não foram criadas para a forma como usaremos computadores no futuro. Esses computadores verão, ouvirão e falarão como nós. Interagiremos com eles como interagimos uns com os outros. Projetamos o framework Agents do LiveKit para facilitar a criação de aplicações para esse novo paradigma. A Cartesia, pioneira da arquitetura SSM, compartilhava nossa convicção de que modelos de IA multimodais em tempo real estariam no centro da computação, tornando-a a parceira ideal para o lançamento do Agents.
Russ e David, do LiveKit, compartilham a visão da Cartesia sobre a necessidade de novas arquiteturas para que a IA multimodal alcance seu verdadeiro potencial. Com o LiveKit, nossos clientes podem criar agentes sofisticados que atendem chamadas telefônicas em apenas algumas horas. Agradecemos a oportunidade de dar voz aos seus agentes para realizar tarefas de raciocínio mais complexas do que nunca.
Usar LiveKit e Cartesia nos permite implantar com eficiência agentes conversacionais confiáveis, com vozes naturais e em escala, para atender nossos clientes 24 horas por dia, melhorando o acesso e a experiência dos pacientes.