-
Notifications
You must be signed in to change notification settings - Fork 43
All issues
Issue creation is restricted in this repository
Issues
is:issue state:open
is:issue state:open
Search results
[nightly-verify]
fix/issue-1388-qwen3-rope-scalingis red (fix/issue-1388-qwen3-rope-scaling)priority:highHigh priorityHigh prioritystatus:readyReady to be worked onReady to be worked ontype:bugBug fixes, error corrections, or issue resolutionsBug fixes, error corrections, or issue resolutionsStatus: Open.#1399 In lablup/mlxcel;feat(plamo2vl): port PLaMo 2.1 VL (SigLIP tiles + RMSNorm/GELU adapter + PLaMo 2 hybrid decoder)
arch:hybridHybrid attention stack (linear/sliding/full or attention+SSM interleave)Hybrid attention stack (linear/sliding/full or attention+SSM interleave)area:cliCommand-line interface / CLI flagsCommand-line interface / CLI flagsarea:docsUser and developer documentationUser and developer documentationarea:inferenceGeneration, sampling, decoding (incl. speculative, DRY)Generation, sampling, decoding (incl. speculative, DRY)area:modelsModel architectures, weights, loading, metadataModel architectures, weights, loading, metadatamodelsize:small4-bit checkpoint <= 10GB; fast iteration, safe for smoke tests4-bit checkpoint <= 10GB; fast iteration, safe for smoke testsmodeltype:vlmVision-language modelVision-language modelpriority:lowLow priorityLow prioritystatus:readyReady to be worked onReady to be worked ontype:enhancementNew features, capabilities, or significant additionsNew features, capabilities, or significant additionsStatus: Open.#1380 In lablup/mlxcel;feat(sampling): add locally typical sampling (
typical_p)area:cliCommand-line interface / CLI flagsCommand-line interface / CLI flagsarea:coremlxcel-core: MLX FFI, primitives, KV cache, layersmlxcel-core: MLX FFI, primitives, KV cache, layersarea:inferenceGeneration, sampling, decoding (incl. speculative, DRY)Generation, sampling, decoding (incl. speculative, DRY)modeltype:textText-only language modelText-only language modelpriority:mediumMedium priorityMedium prioritystatus:blockedBlocked by dependencies or other issuesBlocked by dependencies or other issuestype:enhancementNew features, capabilities, or significant additionsNew features, capabilities, or significant additionsStatus: Open.#1377 In lablup/mlxcel;feat(nemotron_voicechat): cache-aware online session (80 ms frame clock, persistent caches, aligned events, profiler)
arch:hybridHybrid attention stack (linear/sliding/full or attention+SSM interleave)Hybrid attention stack (linear/sliding/full or attention+SSM interleave)area:docsUser and developer documentationUser and developer documentationarea:inferenceGeneration, sampling, decoding (incl. speculative, DRY)Generation, sampling, decoding (incl. speculative, DRY)area:modelsModel architectures, weights, loading, metadataModel architectures, weights, loading, metadatamodelsize:small4-bit checkpoint <= 10GB; fast iteration, safe for smoke tests4-bit checkpoint <= 10GB; fast iteration, safe for smoke testsmodeltype:audioAudio or speech modelAudio or speech modelpriority:mediumMedium priorityMedium prioritystatus:blockedBlocked by dependencies or other issuesBlocked by dependencies or other issuestype:enhancementNew features, capabilities, or significant additionsNew features, capabilities, or significant additionsStatus: Open.#1378 In lablup/mlxcel;feat(server): /v1/realtime WebSocket endpoint for Nemotron VoiceChat sessions (PCM16 base64, one active session, dedicated worker)
area:cliCommand-line interface / CLI flagsCommand-line interface / CLI flagsarea:docsUser and developer documentationUser and developer documentationarea:inferenceGeneration, sampling, decoding (incl. speculative, DRY)Generation, sampling, decoding (incl. speculative, DRY)modeltype:audioAudio or speech modelAudio or speech modelpriority:mediumMedium priorityMedium prioritystatus:blockedBlocked by dependencies or other issuesBlocked by dependencies or other issuestype:enhancementNew features, capabilities, or significant additionsNew features, capabilities, or significant additionsStatus: Open.#1376 In lablup/mlxcel;feat(sampling): add top-n-sigma logit filtering (
top_n_sigma) with a batch-safe row-filter hookarea:cliCommand-line interface / CLI flagsCommand-line interface / CLI flagsarea:coremlxcel-core: MLX FFI, primitives, KV cache, layersmlxcel-core: MLX FFI, primitives, KV cache, layersarea:inferenceGeneration, sampling, decoding (incl. speculative, DRY)Generation, sampling, decoding (incl. speculative, DRY)modeltype:textText-only language modelText-only language modelpriority:mediumMedium priorityMedium prioritystatus:readyReady to be worked onReady to be worked ontype:enhancementNew features, capabilities, or significant additionsNew features, capabilities, or significant additionsStatus: Open.#1375 In lablup/mlxcel;feat(nemotron_voicechat): load the VoiceChat checkpoint and run offline duplex inference (FastConformer+RNNT, Nemotron-H dual-head, EAR-TTS, codec)
arch:hybridHybrid attention stack (linear/sliding/full or attention+SSM interleave)Hybrid attention stack (linear/sliding/full or attention+SSM interleave)area:cliCommand-line interface / CLI flagsCommand-line interface / CLI flagsarea:docsUser and developer documentationUser and developer documentationarea:inferenceGeneration, sampling, decoding (incl. speculative, DRY)Generation, sampling, decoding (incl. speculative, DRY)area:modelsModel architectures, weights, loading, metadataModel architectures, weights, loading, metadatamodelsize:small4-bit checkpoint <= 10GB; fast iteration, safe for smoke tests4-bit checkpoint <= 10GB; fast iteration, safe for smoke testsmodeltype:audioAudio or speech modelAudio or speech modelpriority:mediumMedium priorityMedium prioritystatus:readyReady to be worked onReady to be worked ontype:enhancementNew features, capabilities, or significant additionsNew features, capabilities, or significant additionsStatus: Open.#1374 In lablup/mlxcel;feat(sampling): add hyperparameter-free p-less sampling (
p_less)area:cliCommand-line interface / CLI flagsCommand-line interface / CLI flagsarea:coremlxcel-core: MLX FFI, primitives, KV cache, layersmlxcel-core: MLX FFI, primitives, KV cache, layersarea:inferenceGeneration, sampling, decoding (incl. speculative, DRY)Generation, sampling, decoding (incl. speculative, DRY)modeltype:textText-only language modelText-only language modelpriority:lowLow priorityLow prioritystatus:blockedBlocked by dependencies or other issuesBlocked by dependencies or other issuestype:enhancementNew features, capabilities, or significant additionsNew features, capabilities, or significant additionsStatus: Open.#1373 In lablup/mlxcel;feat(nemotron_voicechat): full-duplex speech model (FastConformer + Nemotron-H + EAR-TTS + codec) with a /v1/realtime session
arch:hybridHybrid attention stack (linear/sliding/full or attention+SSM interleave)Hybrid attention stack (linear/sliding/full or attention+SSM interleave)area:cliCommand-line interface / CLI flagsCommand-line interface / CLI flagsarea:docsUser and developer documentationUser and developer documentationarea:inferenceGeneration, sampling, decoding (incl. speculative, DRY)Generation, sampling, decoding (incl. speculative, DRY)area:modelsModel architectures, weights, loading, metadataModel architectures, weights, loading, metadatamodelsize:small4-bit checkpoint <= 10GB; fast iteration, safe for smoke tests4-bit checkpoint <= 10GB; fast iteration, safe for smoke testsmodeltype:audioAudio or speech modelAudio or speech modelpriority:mediumMedium priorityMedium prioritystatus:readyReady to be worked onReady to be worked ontype:enhancementNew features, capabilities, or significant additionsNew features, capabilities, or significant additionsStatus: Open.#1372 In lablup/mlxcel;feat(core): load and run affine 1-bit checkpoints (
quantization.bits == 1) with a fused Metal matvecarch:denseDense transformer decoderDense transformer decoderarea:coremlxcel-core: MLX FFI, primitives, KV cache, layersmlxcel-core: MLX FFI, primitives, KV cache, layersarea:docsUser and developer documentationUser and developer documentationarea:inferenceGeneration, sampling, decoding (incl. speculative, DRY)Generation, sampling, decoding (incl. speculative, DRY)area:modelsModel architectures, weights, loading, metadataModel architectures, weights, loading, metadatamodelsize:small4-bit checkpoint <= 10GB; fast iteration, safe for smoke tests4-bit checkpoint <= 10GB; fast iteration, safe for smoke testsmodeltype:textText-only language modelText-only language modelpriority:mediumMedium priorityMedium prioritystatus:readyReady to be worked onReady to be worked ontype:enhancementNew features, capabilities, or significant additionsNew features, capabilities, or significant additionsStatus: Open.#1370 In lablup/mlxcel;feat(models): detect and load text-only Youtu-LLM (youtu, youtu_llm) through the existing Youtu MLA decoder
arch:denseDense transformer decoderDense transformer decoderarea:docsUser and developer documentationUser and developer documentationarea:inferenceGeneration, sampling, decoding (incl. speculative, DRY)Generation, sampling, decoding (incl. speculative, DRY)area:modelsModel architectures, weights, loading, metadataModel architectures, weights, loading, metadatamodelsize:small4-bit checkpoint <= 10GB; fast iteration, safe for smoke tests4-bit checkpoint <= 10GB; fast iteration, safe for smoke testsmodeltype:textText-only language modelText-only language modelpriority:mediumMedium priorityMedium prioritystatus:readyReady to be worked onReady to be worked ontype:enhancementNew features, capabilities, or significant additionsNew features, capabilities, or significant additionsStatus: Open.#1371 In lablup/mlxcel;feat(nemotron_parse): port Nemotron-Parse (C-RADIO ViT-H encoder + pre-norm mBART decoder) on the seq2seq worker
arch:denseDense transformer decoderDense transformer decoderarea:cliCommand-line interface / CLI flagsCommand-line interface / CLI flagsarea:docsUser and developer documentationUser and developer documentationarea:inferenceGeneration, sampling, decoding (incl. speculative, DRY)Generation, sampling, decoding (incl. speculative, DRY)area:modelsModel architectures, weights, loading, metadataModel architectures, weights, loading, metadatamodelsize:small4-bit checkpoint <= 10GB; fast iteration, safe for smoke tests4-bit checkpoint <= 10GB; fast iteration, safe for smoke testsmodeltype:vlmVision-language modelVision-language modelpriority:mediumMedium priorityMedium prioritystatus:readyReady to be worked onReady to be worked ontype:enhancementNew features, capabilities, or significant additionsNew features, capabilities, or significant additionsStatus: Open.#1369 In lablup/mlxcel;