这是一个独立的开源实验。
它不与美国人口普查局或商务部有任何关联、认可或赞助关系。
通过本项目获取的数据仍然受原始数据提供者条款的约束(例如,Census API服务条款)。
容器构建2.0相当稳定,但结果质量方面仍存在问题。
将任何AI助手变成你的个人人口普查数据专家。用简单的英语提问,获得准确的人口统计数据,并附带适当的解释和上下文。
之前: "我需要FIPS代码24510的ACS表B19013以及误差计算..."
之后: "巴尔的摩的中位收入与马里兰州相比如何?"
# 运行人口普查MCP服务器(一个命令 - 包含一切!)
docker run -e CENSUS_API_KEY=your_key ghcr.io/brockwebb/census-mcp-server:latest
# 或者不使用API密钥(仍然有效,只是速率限制较慢)
docker run ghcr.io/brockwebb/census-mcp-server:latest
添加到你的claude_desktop_config.json:
macOS: ~/Library/Application Support/Claude/claude_desktop_config.json
Windows: %APPDATA%\Claude\claude_desktop_config.json
{
"mcpServers": {
"census-mcp": {
"command": "docker",
"args": ["run", "--rm", "-i", "-e", "CENSUS_API_KEY=your_census_key", "ghcr.io/brockwebb/census-mcp-server:latest"]
}
}
}
就这样! 重启Claude桌面,你会看到一个🔨锤子图标,表示人口普查工具已就绪。
向Claude提问如下问题:
美国人口普查数据极其有价值,但对于非专业人士来说学习曲线非常陡峭。即使是经验丰富的研究人员也难以应对地理层次、变量命名约定、误差计算以及哪些数据组合实际上可行等问题。根据我们的经验,进行人口统计分析的最大障碍往往是首先弄清楚如何获取正确的数据。
今天: 人口普查数据影响数十亿美元的政府支出和政策决策,但有效地访问它需要专门知识,这为许多潜在用户设置了障碍。
机会: 自然语言到人口普查变量代码的语义匹配是真正新颖的,对于目前不得不手动导航数千个晦涩变量名称的研究人员来说,这可能是变革性的。每个人都应该能够通过世界级的AI助手访问高质量的人口普查数据。
明天: 市议会成员在会议期间实时核查事实。记者在撰写故事时获得人口统计背景。非营利组织了解他们的社区而无需聘请统计学家。研究人员花费时间进行分析而不是与API斗争。
目标: 让美国最有价值的公共数据集像提问一样容易使用。
graph LR
A["用户问题:农村县的贫困率?"] --> B["AI助手(Claude,ChatGPT等)"]
B --> C["人口普查MCP服务器(领域专业知识层)"]
C --> D["tidycensus R包(地理与变量解析)"]
C --> H["知识库(R文档+Census方法论)"]
D --> E["人口普查局API(官方数据源)"]
H --> C
E --> D
D --> C
C --> F["解释的结果+上下文+注意事项"]
F --> B
B --> G["用户得到准确的答案并附有适当解释"]
style C fill:#e1f5fe
style F fill:#f3e5f5
🏗️ 完整自包含系统:
📚 内置智能:
🔄 无需设置:
该系统由五层组成:
每一层都负责其专业功能,创建了一个可以随着AI工具和人口普查数据基础设施的变化而演进的维护系统。
现在可行:
未来扩展: 其他调查、地理可视化、多机构整合
基于: AI工具集成的模型上下文协议(MCP)
核心引擎: Kyle Walker的tidycensus R包
知识库: 使用句子转换器的ChromaDB向量数据库
容器: 包含所有依赖项的约4GB Docker镜像
速率限制: 内置节流和缓存策略
如果你想要修改或扩展系统:
git clone https://github.com/brockwebb/census-mcp-server.git
cd census-mcp-server
# 从源代码构建(需要R、Python和大量设置)
./build.sh
# 或使用预构建的容器并按需修改
docker run -v $(pwd):/workspace ghcr.io/brockwebb/census-mcp-server:latest
本项目建立在以下杰出工作的基础上:
特别感谢Kyle Walker,他的tidycensus文档和方法论构成了我们知识库的基础。这个项目基本上是在tidycensus的基础上增加了自然语言智能 - 所有的统计和地理难题都是由tidycensus团队解决的。
本项目旨在普及公共数据的访问。我们欢迎以下方面的贡献:
"模式永远不会真正消失,它们只是获得了更好的用户体验"