ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್ಗಳು
ಕೇವಲ PostgreSQL ಆಗಿರುವ ನಿರ್ವಹಿಸಲ್ಪಡುವ ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್
ಎಂಬೆಡಿಂಗ್ಗಳನ್ನು ಸ್ಟೋರ್ ಮಾಡಿ ಮತ್ತು ಅರ್ಥದ ಮೂಲಕ ಅವುಗಳನ್ನು ಹುಡುಕಿ, ನಾವು ರನ್ ಮಾಡಿ ಬ್ಯಾಕಪ್ ಮಾಡುವ pgvector ಮೇಲೆ. ಕಲಿಯಲು ಯಾವುದೇ ಹೊಸ ಡೇಟಾಸ್ಟೋರ್ ಇಲ್ಲ, ಸೈಜ್ ಮಾಡಲು ಯಾವುದೇ ಕ್ಲಸ್ಟರ್ ಇಲ್ಲ — ಇಂಡೆಕ್ಸ್ ಅನ್ನು ರಚಿಸಿ, ನಿಮ್ಮ ವೆಕ್ಟರ್ಗಳನ್ನು ಬರೆಯಿರಿ ಮತ್ತು ನೀವು ಈಗಾಗಲೇ ಹೊಂದಿರುವ API ಕೀ ಬಳಸಿ ಅದನ್ನು ಕ್ವೈರಿ ಮಾಡಿ.
ನೀವು ಈಗಾಗಲೇ ನಂಬಿರುವ ಡೇಟಾಬೇಸ್, ಒಂದು ಹೆಚ್ಚುವರಿ ಕಾಲಮ್ ಪ್ರಕಾರದೊಂದಿಗೆ
ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್ ಸಾಮಾನ್ಯವಾಗಿ ಮೊದಲನೆಯದರ ಜೊತೆಗೆ ರನ್ ಮಾಡಲು ಎರಡನೇ ವ್ಯವಸ್ಥೆಯಾಗಿದೆ: ಮತ್ತೊಂದು ಕ್ಲಸ್ಟರ್, ಮತ್ತೊಂದು ಬ್ಯಾಕಪ್ ಸ್ಟೋರಿ, ಎಚ್ಚರಗೊಳಿಸಬೇಕಾದ ಮತ್ತೊಂದು ವಿಷಯ. ಇದು PostgreSQL ಒಳಗಿನ pgvector ಆಗಿದೆ - ಅದೇ ಎಂಜಿನ್, ಅದೇ ಬಾಳಿಕೆ, ಅದೇ ರಾತ್ರಿಯ ಬೇಸ್ ಬ್ಯಾಕಪ್ ಮತ್ತು ನಿರಂತರ ರೈಟ್-ಅಹೆಡ್ ಲಾಗ್ ಆರ್ಕೈವಿಂಗ್ ಇಲ್ಲಿರುವ ಎಲ್ಲವೂ ಪಡೆಯುತ್ತದೆ. ನಿಮ್ಮ ಇಂಡೆಕ್ಸ್ ಅದರ ಮೇಲೆ HNSW ಇಂಡೆಕ್ಸ್ ಹೊಂದಿರುವ ಸಾಮಾನ್ಯ ಟೇಬಲ್ ಆಗಿದೆ, ಆದ್ದರಿಂದ ಇದು ಅಂದಾಜು ಹತ್ತಿರದ-ನೆರೆಹೊರೆಯ ಹುಡುಕಾಟಕ್ಕೆ ವೇಗವಾಗಿರುತ್ತದೆ ಮತ್ತು ಪ್ರತಿಯೊಂದು ಇತರ ದೃಷ್ಟಿಯಿಂದ ಬೇಸರ ತರಿಸುತ್ತದೆ, ಇದು ಬೆಳಿಗ್ಗೆ ಮೂರು ಗಂಟೆಗೆ ನೀವು ಬಯಸುವ ಗುಣಲಕ್ಷಣವಾಗಿದೆ.
ನಿಮ್ಮ ಮಾಡೆಲ್ನ ಅಗಲ, ನಾವು ಆಯ್ಕೆ ಮಾಡಿದ್ದಲ್ಲ
ಹೆಚ್ಚಿನ ನಿರ್ವಹಿಸಲ್ಪಡುವ ವೆಕ್ಟರ್ ಸೇವೆಗಳು ಆಯಾಮಗಳ ಚಿಕ್ಕ ಪಟ್ಟಿಯಿಂದ ಆಯ್ಕೆ ಮಾಡಲು ನಿಮಗೆ ನಿರ್ಬಂಧಿಸುತ್ತವೆ. ನಿಮ್ಮದು ಪೂರ್ಣಾಂಕ ಸಂಖ್ಯೆಯಾಗಿರಬೇಕಾದ ಅಗತ್ಯವಿಲ್ಲ: 1 ರಿಂದ 3072 ರವರೆಗಿನ ಯಾವುದನ್ನಾದರೂ ಸ್ವೀಕರಿಸಲಾಗುತ್ತದೆ ಮತ್ತು ನಿಖರವಾಗಿ ಇರಿಸಲಾಗುತ್ತದೆ, ಏಕೆಂದರೆ ಕಿರಿದಾದ ವೆಕ್ಟರ್ ಅನ್ನು ಶೂನ್ಯಗಳೊಂದಿಗೆ ಮುಂದಿನ ಭೌತಿಕ ಅಗಲಕ್ಕೆ ಪ್ಯಾಡ್ ಮಾಡಲಾಗುತ್ತದೆ — ಇದು ಕೊಸೈನ್, ಯುಕ್ಲಿಡಿಯನ್ ಮತ್ತು ಆಂತರಿಕ-ಉತ್ಪನ್ನದ (inner-product) ದೂರವನ್ನು ನಿಖರವಾಗಿ ಏನನ್ನೂ ಬದಲಾಯಿಸುವುದಿಲ್ಲ. 1408-ಆಯಾಮದ ಮಾದರಿಯು ಸ್ಥಳೀಯವಾಗಿ ಗಾತ್ರವನ್ನು ಹೊಂದಿರುವ ಮಾದರಿಯಂತೆಯೇ ಶ್ರೇಣೀಕರಿಸಲ್ಪಡುತ್ತದೆ ಮತ್ತು ರೀಡ್ಗಳು ನೀವು ಸಂಗ್ರಹಿಸಿದ 1408 ಮೌಲ್ಯಗಳನ್ನು ನಿಮಗೆ ಮರಳಿ ನೀಡುತ್ತವೆ, ಪ್ಯಾಡಿಂಗ್ ಅನ್ನು ಎಂದಿಗೂ ನೀಡುವುದಿಲ್ಲ.
ಪ್ರತಿ ವೆಕ್ಟರ್ ಪ್ಲಾನ್ನಲ್ಲಿ ಸೇರಿಸಲಾಗಿದೆ
- 3072 ರವರೆಗೆ ಯಾವುದೇ ಎಂಬೆಡಿಂಗ್ ಅಗಲ, ಮತ್ತು ಕೋಸೈನ್, ಯುಕ್ಲಿಡಿಯನ್ ಅಥವಾ ಇನ್ನರ್-ಪ್ರೊಡಕ್ಟ್ ದೂರ
- ಪ್ರತಿ ವೆಕ್ಟರ್ನೊಂದಿಗೆ ಮೆಟಾಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸಲಾಗುತ್ತದೆ ಮತ್ತು ಪ್ರಶ್ನಿಸುವ ಸಮಯದಲ್ಲಿ ಫಿಲ್ಟರ್ ಮಾಡಲಾಗುತ್ತದೆ
- 30 ದಿನಗಳವರೆಗೆ ಉಳಿಸಿಕೊಳ್ಳುವಿಕೆ ಮತ್ತು ಪಾಯಿಂಟ್-ಇನ್-ಟೈಮ್ ರಿಕವರಿ ಜೊತೆಗೆ ರಾತ್ರಿಯ ವೇಳೆಯ ಬ್ಯಾಕಪ್ಗಳು
- ಸಾಲು-ಮಟ್ಟದ ಭದ್ರತೆ, ಇದರಿಂದಾಗಿ ಒಂದು ಸಂಸ್ಥೆಯ ವೆಕ್ಟರ್ಗಳನ್ನು ಮತ್ತೊಂದು ಸಂಸ್ಥೆಯಿಂದ ತಲುಪಲು ಸಾಧ್ಯವಿಲ್ಲ
ಯೋಜನೆಗಳು ಮತ್ತು ಬೆಲೆಗಳು
ಮೂರು ಹಂತಗಳು, ನಮಗೆ ವಾಸ್ತವವಾಗಿ ವೆಚ್ಚ ತರುವ ಎರಡು ವಿಷಯಗಳ ಮೇಲೆ ಬೆಲೆ ನಿಗದಿಪಡಿಸಲಾಗಿದೆ: ನೀವು ಎಷ್ಟು ಸಂಗ್ರಹಿಸುತ್ತೀರಿ ಮತ್ತು ನೀವು ಎಷ್ಟು ಹುಡುಕುತ್ತೀರಿ.
ನಿಮ್ಮ ಕಾನ್ಫಿಗರೇಶನ್ ಆಧರಿಸಿ ಬೆಲೆ ನಿಗದಿಪಡಿಸಲಾಗಿದೆ
ಖರ್ಚು ನೀವು ಆಯ್ಕೆ ಮಾಡುವ ಪ್ರದೇಶ, ಯಂತ್ರದ ಗಾತ್ರ, ಬ್ಯಾಂಡ್ವಿಡ್ತ್ ಮತ್ತು ಸ್ಟೋರೇಜ್ ಅನ್ನು ಅವಲಂಬಿಸಿರುತ್ತದೆ, ಆದ್ದರಿಂದ ನಾವಿಲ್ಲಿ ಖಚಿತವಾಗಿ ನಮೂದಿಸಬಹುದಾದ ಯಾವುದೇ ಏಕೈಕ ಮಾಸಿಕ ಮೊತ್ತವಿಲ್ಲ. ನಿಮ್ಮ ವರ್ಕ್ಲೋಡ್ ಅನ್ನು ನಮಗೆ ತಿಳಿಸಿ, ನಾವು ಅದಕ್ಕೆ ತಕ್ಕಂತೆ ಬೆಲೆಯನ್ನು ತಿಳಿಸುತ್ತೇವೆ.
100% ನವೀಕರಿಸಬಹುದಾದ ಶಕ್ತಿಯಿಂದ ನಡೆಸಲ್ಪಡುತ್ತದೆ
ನಾವು ರನ್ ಮಾಡುವ ಪ್ರತಿಯೊಂದು ಸರ್ವರ್ ಮತ್ತು ಪ್ರತಿಯೊಂದು ಉತ್ಪನ್ನವು ನವೀಕರಿಸಬಹುದಾದ ವಿದ್ಯುತ್ನಿಂದ ಚಾಲಿತವಾಗಿದೆ. ನಂತರದ ದಿನಗಳಲ್ಲಿ ಸರಿಪಡಿಸಿದ್ದಲ್ಲ — ಅದೇ ರೀತಿಯಲ್ಲಿ ಮೂಲದಿಂದ ಪಡೆಯಲಾಗಿದೆ.
- ನಮ್ಮ ಎಲ್ಲಾ ಹೋಸ್ಟಿಂಗ್ನಲ್ಲಿ 100% ನವೀಕರಿಸಬಹುದಾದ ವಿದ್ಯುತ್
- ೧.೧ ರಿಂದ ೧.೨ ರ PUE ನಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಿರುವ ಡೇಟಾ ಕೇಂದ್ರಗಳು
- ನಮ್ಮ ಹಂಚಿದ ಪ್ಲಾಟ್ಫಾರ್ಮ್ನಲ್ಲಿರುವ ಸೈಟ್ಗಳು ಗ್ರೀನ್ ವೆಬ್ ಫೌಂಡೇಶನ್ನ ಪರಿಶೀಲನೆಗಳನ್ನು ಪಾಸ್ ಮಾಡುತ್ತವೆ — ಇದು ನೀವೇ ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಬಹುದಾದ ಮೂರನೇ ವ್ಯಕ್ತಿಯಾಗಿದೆ
ನಮ್ಮ ಪ್ಲಾಟ್ಫಾರ್ಮ್ ಅನ್ನು ನಾವು ಹೇಗೆ ನಿರ್ವಹಿಸುತ್ತೇವೆ ಎಂಬುದನ್ನು ಓದಿ
ಖರೀದಿಸುವ ಮೊದಲು ಜನರು ಕೇಳುವ ಪ್ರಶ್ನೆಗಳು
ಇದು ಯಾವ ಎಂಬೆಡಿಂಗ್ ಮಾದರಿಗಳೊಂದಿಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ?
ಯಾವುದೇ ಒಂದನ್ನು. ನಿಮ್ಮ ಮಾದರಿಯು ಉತ್ಪಾದಿಸುವ ಸಂಖ್ಯೆಗಳನ್ನು ನೀವು ನಮಗೆ ಕಳುಹಿಸುತ್ತೀರಿ, ಆದ್ದರಿಂದ OpenAI, Cohere, Voyage, ನಿಮ್ಮ ಸ್ವಂತ ಯಂತ್ರದಲ್ಲಿರುವ Sentence-Transformers ಮಾದರಿ ಮತ್ತು ಇನ್ಯಾವುದೇ ಆಗಿರಲಿ ಎಲ್ಲವೂ ನಮಗೆ ಒಂದೇ. ಸೂಚ್ಯಂಕವನ್ನು ರಚಿಸುವಾಗ ನೀವು ಅಗಲವನ್ನು ನಮಗೆ ತಿಳಿಸುತ್ತೀರಿ — 384, 768, 1024, 1536 ಮತ್ತು 3072 ಎಲ್ಲವೂ ಸಾಮಾನ್ಯವಾಗಿದೆ, ಮತ್ತು ಅವುಗಳ ನಡುವಿನ ಯಾವುದಾದರೂ ಆಗಿರಬಹುದು.
ನಾನು ನಂತರ ಸೂಚ್ಯಂಕದ (index) ಅಗಲ ಅಥವಾ ದೂರದ ಕಾರ್ಯವನ್ನು (distance function) ಬದಲಾಯಿಸಬಹುದೇ?
ಇಲ್ಲ, ಮತ್ತು ನೀವು ಅದನ್ನು ಕಂಡುಕೊಳ್ಳುವಂತೆ ಬಿಡುವುದಕ್ಕಿಂತ ಸ್ಪಷ್ಟವಾಗಿ ಹೇಳಲು ನಾವು ಬಯಸುತ್ತೇವೆ. ಎರಡೂ ಸಹ ನಿಮ್ಮ ವೆಕ್ಟರ್ಗಳನ್ನು ಭೌತಿಕವಾಗಿ ಎಲ್ಲಿ ಸಂಗ್ರಹಿಸಲಾಗಿದೆ ಮತ್ತು ಅವುಗಳನ್ನು ಹೇಗೆ ಶ್ರೇಣೀಕರಿಸಲಾಗಿದೆ ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸುತ್ತವೆ, ಆದ್ದರಿಂದ ಯಾವುದನ್ನಾದರೂ ಬದಲಾಯಿಸುವುದರಿಂದ ಈಗಾಗಲೇ ಸೂಚ್ಯಂಕದಲ್ಲಿರುವ ಎಲ್ಲವನ್ನೂ ಮೌನವಾಗಿ ಅಮಾನ್ಯಗೊಳಿಸುತ್ತದೆ. ನೀವು ಬೇರೆ ಎಂಬೆಡಿಂಗ್ ಮಾದರಿಗೆ ಬದಲಾಯಿಸಿದರೆ, ಎರಡನೇ ಸೂಚ್ಯಂಕವನ್ನು ರಚಿಸಿ ಮತ್ತು ಅದಕ್ಕೆ ಬರೆಯಿರಿ - ಪ್ರತಿ ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್ ನಿಮ್ಮನ್ನು ಕೇಳುವ ಅದೇ ವಿಷಯ, ಮತ್ತು ಅದೇ ಕಾರಣಕ್ಕಾಗಿ.
ತುಂಬಾ ಅಗಲವಾದ ವೆಕ್ಟರ್ಗಳ ಬಗ್ಗೆ ಏನಾದರೂ ಭಿನ್ನವಿದೆಯೇ?
ಹೌದು, ಮತ್ತು ಇದು ತಿಳಿದುಕೊಳ್ಳಲು ಯೋಗ್ಯವಾಗಿದೆ. 2,000 ಆಯಾಮಗಳಿಗಿಂತ ಹೆಚ್ಚಿರುವಾಗ ಮೌಲ್ಯಗಳನ್ನು ಅರ್ಧ-ನಿಖರತೆಯಲ್ಲಿ ಸಂಗ್ರಹಿಸಲಾಗುತ್ತದೆ, ಏಕೆಂದರೆ PostgreSQL ನ HNSW ಇಂಡೆಕ್ಸ್ ಅದಕ್ಕಿಂತ ಹೆಚ್ಚಿನ ಪೂರ್ಣ-ನಿಖರತೆಯ ಕಾಲಮ್ ಅನ್ನು ಸ್ವೀಕರಿಸುವುದಿಲ್ಲ. 3072-ಆಯಾಮದ ಮಾದರಿಗಳಿಗೆ pgvector ಸ್ವತಃ ಶಿಫಾರಸು ಮಾಡುವ ವಿಧಾನ ಇದೇ ಆಗಿದೆ ಮತ್ತು ಶ್ರೇಯಾಂಕದ ಮೇಲಿನ ಪರಿಣಾಮವು ನಗಣ್ಯವಾಗಿದೆ — ಆದರೆ ಇದು ನಿಜವಾದ ರಾಜಿ ಮತ್ತು ನೀವು ಅದನ್ನು ನಮಿಂದಲೇ ತಿಳಿಯಬೇಕು ಹೊರತು ನೀವೇ ಊಹಿಸಿಕೊಳ್ಳಬಾರದು.
ನನಗೆ ಡೇಟಾಬೇಸ್ ಕನೆಕ್ಷನ್ ಸ್ಟ್ರಿಂಗ್ ಸಿಗುತ್ತದೆಯೇ?
ಇಂದಲ್ಲ. ನೀವು ಹುಡುಕಾಟ ನಡೆಸುವ ಕೀಲಿಯು ನಿಮ್ಮ ಖಾತೆಯಲ್ಲಿ ಬೇರೆ ಯಾವುದೇ ಕಾರ್ಯವನ್ನು ಮಾಡಲು ಸಾಧ್ಯವಾಗದಂತೆ ಸ್ಕೋಪ್ ಮಾಡಲಾದ ನಿಮ್ಮ Zinn® API ಕೀಲಿಯೊಂದಿಗೆ HTTPS ಮೂಲಕ ನಿಮ್ಮ ಇಂಡೆಕ್ಸ್ ಅನ್ನು ತಲುಪುತ್ತೀರಿ. ಅದುವೇ ನಾವು ಕ್ವೆರಿಗಳನ್ನು ಪ್ರಾಮಾಣಿಕವಾಗಿ ಅಳೆಯಲು ಮತ್ತು ಒಬ್ಬ ಟೆನೆಂಟ್ನ ಸಾಲುಗಳನ್ನು ಇನ್ನೊಬ್ಬರು ಪ್ರವೇಶಿಸಲು ಸಾಧ್ಯವಾಗದಂತೆ ಮಾಡಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ. ನಿಮಗೆ ನೇರ ಸಂಪರ್ಕದ ಅಗತ್ಯವಿದ್ದರೆ, ನಮಗೆ ತಿಳಿಸಿ — ಯಾರೋ ಕೇಳಿದ್ದಾರೆಂಬ ಕಾರಣಕ್ಕಾಗಿ ಅದನ್ನು ನಿರ್ಮಿಸಲು ನಾವು ಬಯಸುತ್ತೇವೆಯೇ ಹೊರತು ಊಹಿಸಿ ಅಲ್ಲ.
ಇದನ್ನು ಹೇಗೆ ಅಳೆಯಲಾಗುತ್ತದೆ ಮತ್ತು ನಾನು ಸಂಖ್ಯೆಗಳನ್ನು ನೀವೇ ಪರಿಶೀಲಿಸಬಹುದೇ?
ಎರಡು ಮೀಟರ್ಗಳಲ್ಲಿ: ಕ್ಯಾಲೆಂಡರ್ ತಿಂಗಳಲ್ಲಿ ನೀವು ಎಷ್ಟು ಸಂಗ್ರಹಿಸುತ್ತೀರಿ ಮತ್ತು ಎಷ್ಟು ಹುಡುಕಾಟಗಳನ್ನು ನಡೆಸುತ್ತೀರಿ. ಇವೆರಡೂ ಸಂಭವಿಸಿದಂತೆ ನಿಮ್ಮ ಡ್ಯಾಶ್ಬೋರ್ಡ್ನಲ್ಲಿರುತ್ತವೆ. ಸಂಗ್ರಹಣೆಯು ಭೌತಿಕ ಕೋಷ್ಟಕದ ಗಾತ್ರಕ್ಕಿಂತ ಪ್ರಕಟಿತ ಸೂತ್ರವಾಗಿದೆ - ಸಾಲಿನ ಓವರ್ಹೆಡ್, ಸಂಗ್ರಹಿಸಿದ ಅಗಲ ಮತ್ತು ನಿಮ್ಮ ಸ್ವಂತ ಐಡಿಗಳು ಮತ್ತು ಮೆಟಾಡೇಟಾದ ಉದ್ದ - ನಿಖರವಾಗಿ ನಮ್ಮ ಮಾತನ್ನು ನಂಬುವ ಬದಲು ನಾವು ನಿಮಗೆ ಬಿಲ್ ಮಾಡುತ್ತಿರುವ ಅಂಕಿ ಅಂಶವನ್ನು ನೀವು ಮರುಸೃಷ್ಟಿಸಬಹುದು.