OpenHands’i Ollama veya vLLM gibi local/self-hosted inference endpoint’lerine bağlarken model seçimi, endpoint erişimi, context ve GPU kapasitesini birlikte planlama rehberi.
Komutları canlı sistemde uygulamadan önce sürüm, yedek, firewall ve geri dönüş planını kendi altyapınızda doğrulayın.
Agent katmanı local provider endpoint’ine istek gönderir; runtime’ın endpoint’e ağ üzerinden erişebilmesi gerekir. Kod ajanlarında model kalitesi kadar context ve tool-use başarısı önemlidir; quantized büyük modeller için VRAM ve token throughput birlikte ölçülmelidir.
Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz.
Agent katmanı local provider endpoint’ine istek gönderir; runtime’ın endpoint’e ağ üzerinden erişebilmesi gerekir.
OpenHands + Ollama / vLLM Local Model Kurulumu için tasarım kararı yalnız servislerin ayağa kalkmasına göre verilmemeli. Inference endpoint private ağda tutulabilir; API key, firewall ve runtime egress policy ile erişim daraltılmalıdır. Mimari doğrulamada OpenHands Local LLMs dokümantasyonu ile gerçek ağ ve veri akışı birlikte karşılaştırılmalıdır.
Kod ajanlarında model kalitesi kadar context ve tool-use başarısı önemlidir; quantized büyük modeller için VRAM ve token throughput birlikte ölçülmelidir.
Container içinden hosttaki Ollama’ya localhost ile erişilememesi yaygın bir network namespace problemidir. Bu yüzden kapasite testi, OpenHands + Ollama / vLLM Local Model Kurulumu üzerinde gerçek veri ve eşzamanlı iş yüküyle yapılmalı; yalnız boşta kullanılan RAM değeri satın alma kararına dönüştürülmemelidir.
Kod ajanlarında model kalitesi kadar context ve tool-use başarısı önemlidir; quantized büyük modeller için VRAM ve token throughput birlikte ölçülmelidir. GPU veya hızlandırıcı kullanılan senaryoda aynı model/veri, aynı concurrency ve aynı ölçüm süresi korunmadan yapılan karşılaştırma güvenilir değildir.
Karşılaştırmada aynı veri/model, aynı concurrency ve aynı ölçüm penceresi korunur. Container içinden hosttaki Ollama’ya localhost ile erişilememesi yaygın bir network namespace problemidir. Sonuç tablosuna throughput yanında başarısız iş oranı ve peak kaynak kullanımı da eklenmelidir.
Inference endpoint private ağda tutulabilir; API key, firewall ve runtime egress policy ile erişim daraltılmalıdır.
OpenHands + Ollama / vLLM Local Model Kurulumu için erişim politikası deployment sonrasında eklenen bir ayrıntı değildir. Agent katmanı local provider endpoint’ine istek gönderir; runtime’ın endpoint’e ağ üzerinden erişebilmesi gerekir. Bu akışta public olması gerekmeyen database, worker, runtime veya yönetim portları private ağda tutulmalıdır.
Model değiştirirken aynı görev setiyle başarı oranı, latency ve token tüketimi karşılaştırılmalıdır; tek prompt benchmark yeterli değildir.
Canlıya geçiş kontrolünde şu komut/işlem hattı da doğrulama noktası olarak kullanılabilir: curl http://127.0.0.1:11434/api/tags. Container içinden hosttaki Ollama’ya localhost ile erişilememesi yaygın bir network namespace problemidir. Bu kontrol başarısızsa release ilerletilmeden önce geri dönüş noktası test edilmelidir.
Container içinden hosttaki Ollama’ya localhost ile erişilememesi yaygın bir network namespace problemidir.
OpenHands + Ollama / vLLM Local Model Kurulumu arızasında semptom ile kök nedeni ayırmak için önce son değişiklik zamanı kaydedilir. Kod ajanlarında model kalitesi kadar context ve tool-use başarısı önemlidir; quantized büyük modeller için VRAM ve token throughput birlikte ölçülmelidir. Ardından servis logu, dependency health ve ağ erişimi aynı zaman diliminde karşılaştırılır.
Agent katmanı local provider endpoint’ine istek gönderir; runtime’ın endpoint’e ağ üzerinden erişebilmesi gerekir. Kod ajanlarında model kalitesi kadar context ve tool-use başarısı önemlidir; quantized büyük modeller için VRAM ve token throughput birlikte ölçülmelidir.
| Belirti / problem | Muhtemel katman | İlk doğrulama |
|---|---|---|
| Sandbox başlıyor fakat workspace yazılamıyor | Container içinden hosttaki Ollama’ya localhost ile erişilememesi yaygın bir network namespace problemidir. | İlgili servis logu, dependency health ve son değişiklik zamanı tek zaman çizgisinde karşılaştırılır. |
| Agent local model endpoint’ine ulaşamıyor | Kod ajanlarında model kalitesi kadar context ve tool-use başarısı önemlidir; quantized büyük modeller için VRAM ve token throughput birlikte ölçülmelidir. | Peak kaynak kullanımı, concurrency ve disk/network baskısı aynı test penceresinde ölçülür. |
| Tool çağrıları bozuk JSON/timeout üretiyor | Inference endpoint private ağda tutulabilir; API key, firewall ve runtime egress policy ile erişim daraltılmalıdır. | Public/private portlar, kimlik doğrulama, TLS ve secret kapsamı dıştan içe doğrulanır. |
| GPU var fakat görev başarı oranı düşük | Model değiştirirken aynı görev setiyle başarı oranı, latency ve token tüketimi karşılaştırılmalıdır; tek prompt benchmark yeterli değildir. | Sürüm, config diff, kalıcı veri ve geri dönüş noktası birlikte kontrol edilir. |
Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz.
OpenHands’i Ollama veya vLLM gibi local/self-hosted inference endpoint’lerine bağlarken model seçimi, endpoint erişimi, context ve GPU kapasitesini birlikte planlama rehberi.
Agent katmanı local provider endpoint’ine istek gönderir; runtime’ın endpoint’e ağ üzerinden erişebilmesi gerekir.
Kod ajanlarında model kalitesi kadar context ve tool-use başarısı önemlidir; quantized büyük modeller için VRAM ve token throughput birlikte ölçülmelidir.
Inference endpoint private ağda tutulabilir; API key, firewall ve runtime egress policy ile erişim daraltılmalıdır.
Model değiştirirken aynı görev setiyle başarı oranı, latency ve token tüketimi karşılaştırılmalıdır; tek prompt benchmark yeterli değildir.
Container içinden hosttaki Ollama’ya localhost ile erişilememesi yaygın bir network namespace problemidir.
Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz.
ollama listcurl http://127.0.0.1:11434/api/tagscurl http://127.0.0.1:8000/v1/modelsnvidia-smiModel ağırlığı için yaklaşık VRAM planlama aracı
Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz. Kod ajanlarında model kalitesi kadar context ve tool-use başarısı önemlidir; quantized büyük modeller için VRAM ve token throughput birlikte ölçülmelidir.
Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz.
Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz.
Agent katmanı local provider endpoint’ine istek gönderir; runtime’ın endpoint’e ağ üzerinden erişebilmesi gerekir. Kod ajanlarında model kalitesi kadar context ve tool-use başarısı önemlidir; quantized büyük modeller için VRAM ve token throughput birlikte ölçülmelidir.
Agent katmanı local provider endpoint’ine istek gönderir; runtime’ın endpoint’e ağ üzerinden erişebilmesi gerekir.
Inference endpoint private ağda tutulabilir; API key, firewall ve runtime egress policy ile erişim daraltılmalıdır.
Kod ajanlarında model kalitesi kadar context ve tool-use başarısı önemlidir; quantized büyük modeller için VRAM ve token throughput birlikte ölçülmelidir.
Model değiştirirken aynı görev setiyle başarı oranı, latency ve token tüketimi karşılaştırılmalıdır; tek prompt benchmark yeterli değildir.
Container içinden hosttaki Ollama’ya localhost ile erişilememesi yaygın bir network namespace problemidir.
Hayır. Araç ilk planlama için yaklaşık sonuç üretir. Kod ajanlarında model kalitesi kadar context ve tool-use başarısı önemlidir; quantized büyük modeller için VRAM ve token throughput birlikte ölçülmelidir. Son karar gerçek workload ölçümüyle doğrulanmalıdır.
Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz. Kod ajanlarında model kalitesi kadar context ve tool-use başarısı önemlidir; quantized büyük modeller için VRAM ve token throughput birlikte ölçülmelidir.