alphaparkinc/genpark-multimodal-spatial-audio-visual-grounding-skill
Real-time Multimodal Spatial Audio-Visual Grounding Engine (inspired by Meta Ray-Ban & Meta Muse). Fuses 2D/3D visual bounding boxes, user head-pose gaze vectors, and acoustic beamforming azimuth angles into cross-modal focal salience scores and resolves deictic spatial references.
GitHub repository with 7 stars and 0 forks.
Language: Python
Topics: agentic-commerce, autonomous-agent, developer-tools, enterprise-ai, managed-agents, mcp, mcp-server, model-context-protocol, multimodal-ai, zero-dependency