web-llm-chat
直接在浏览器本地运行大模型并私密聊天
- Stars
- 1,063
- Forks
- 225
- 更新时间
- 更新于 2026年7月13日
直接在浏览器本地运行大模型并私密聊天
WebLLM Chat 利用 WebGPU 在浏览器内加载并运行大语言模型,让提示词、回复和模型处理留在本机,而不是交给云端推理服务。完成首次设置和模型下载后,它可离线使用,界面支持 Markdown、图片输入和多种内置模型;高级用户还可连接通过 MLC-LLM 提供的自定义模型接口。使用浏览器原生推理需要浏览器支持 WebGPU。
资源类型
使用场景
运行方式
协议与集成
用主题串联实时和异步团队聊天
通过网页或桌面端接入 Matrix,进行聊天与团队协作。
适合人群
GitHub 公开事实最近同步于 2026年7月14日。
用 Docker 在本机部署私有的 Llama 2 聊天界面
通过简洁的网页客户端使用 Matrix 聊天服务