Descrição
Modelos Transformer podem rodar inferência eficiente pelo runtime C++ e Python do CTranslate2. Este pacote é para desenvolvedores de IA que implantam cargas de tradução ou modelos de linguagem. Entradas de modelo podem conter texto privado, e inferência pode consumir muitos recursos de CPU ou GPU.