O Kimi K3 suporta uma janela de contexto de 1 milhão de tokens. A maioria das discussões foca no que o modelo pode processar. Mas, se seu aplicativo móvel enviar solicitações para um back-end alimentado por K3, a janela de contexto também é uma restrição móvel.
O problema móvel com contextos grandes
Um cliente móvel geralmente envia um prompt e recebe uma resposta. O contexto vive no lado do servidor. Mas modelos de grande contexto introduzem três preocupações específicas para dispositivos móveis:
1. Latência aumenta com o contexto
Uma solicitação de 1 milhão de tokens leva mais tempo para processar do que uma solicitação de 4K tokens. Em um dispositivo móvel, onde os usuários esperam respostas em menos de 3 segundos, essa latência precisa ter um plano:
| Tamanho do contexto | Tempo de processamento esperado | Implicações para a UX móvel |
|---|---|---|
| 4K tokens | 1-3 segundos | Resposta imediata |
| 50K tokens | 5-15 segundos | Necessidade de estado de carregamento |
| 500K tokens | 30-120 segundos | Necessidade de streaming progressivo |
| 1M tokens | 60-300 segundos | Padrão de tarefa em segundo plano |
Se seu aplicativo móvel enviar um grande contexto de forma sincronizada, o usuário espera. Se você transmitir a resposta, o usuário vê o progresso. Se você enviá-lo como uma tarefa em segundo plano, o usuário pode sair e retornar.
2. Recuperação do estado ao longo do ciclo de vida do aplicativo
No móvel, o sistema operacional pode matar seu aplicativo a qualquer momento. Se sua solicitação de agente estiver em trânsito com um contexto de 1 milhão de tokens, o cliente precisa:
- Monitorar o ID da solicitação para poder reconectar
- Retomar o fluxo de resposta do ponto onde parou
- Lidar com o caso em que o servidor concluiu a solicitação enquanto o aplicativo estava em segundo plano
Isto não é novo para desenvolvedores móveis, mas os longos tempos de processamento dos modelos de grande contexto tornam isso o caminho padrão, não um caso de extremidade.
3. Largura de banda e custo
Enviar um grande contexto para o servidor consome largura de banda e dinheiro. O preço de entrada do K3 é de 20 CNY por milhão de tokens. Um contexto de 100K tokens custa 2 CNY por solicitação de entrada apenas. Em planos de dados móveis, isso também é um custo para o usuário.
Um cliente móvel deve:
- Envie apenas o contexto necessário para a tarefa (não o máximo permitido)
- Cace respostas anteriores para evitar reenviar o contexto
- Permita que o usuário veja o custo de tokens antes de confirmar uma solicitação grande
Um contrato de contexto móvel
mobile_agent_request:
max_context_tokens: 20000
streaming: true
request_id: generated_uuid
resume_supported: true
background_task
