Visão geral
Um motor de inferência leve e local para FlutterGemma usando Dart:ffi, com suporte a cinco plataformas nativas e web. Permite inferência eficiente de modelos de linguagem grandes (LLM) localmente por meio do backend de incorporação da API C LiteRT com integração opcional de provedores. Projetado para aplicações de IA gerativa de baixa latência e focadas na privacidade, diretamente nos dispositivos, sem depender de serviços em nuvem. O pacote simplifica a implantação em ambientes Android, iOS, Linux, macOS, Windows e web.
Casos de uso
- inferência de modelo de linguagem no dispositivo
- Aplicativos de bate-papo com preservação de privacidade
- Aplicativos com IA off-line
- Computação de borda para LLMs
- Implantação leve de LLM em dispositivos móveis e desktop
Principais recursos
- Suporte a plataforma nativa (5+ plataformas)
- Compatibilidade com Web por meio do Dart:ffi
- InferenceEngineProvider de opção
- Backend embutido da API C do LiteRT
- Sobrecarga mínima de tempo de execução
- Consistência multiplataforma
Indicado para
- Desenvolvedores construindo aplicativos de LLM offline
- Aplicativos que exigem privacidade de dados
- Protótipos de IA para dispositivos móveis e desktop
- Projetos de IA em borda com recursos limitados
- Equipes usando Flutter para IA generativa
Considerações
- Requer compilação de código nativo
- Limitado a modelos compatíveis com o LiteRT
- O suporte a Web depende da disponibilidade do WASM
- O desempenho varia conforme o hardware do dispositivo
- Sem gerenciamento ou cache de modelo embutido